코드는 재는데 글은 아무도 재지 않았다

LLM 벤치마크는 대부분 코딩과 수학에 몰려 있다. 정답이 명확해 채점이 쉽기 때문이다. 그런데 내가 실제로 모델에 가장 많이 시키는 일 중 하나는 글쓰기다. 채점이 어렵다는 이유로 아무도 재지 않는 영역이, 정작 사용량이 가장 많은 영역인 셈이다. 그래서 한국어 글이 얼마나 사람처럼 자연스러운지 측정하는 벤치마크를 직접 만들었다.

Read more