LLM 벤치마크는 대부분 코딩과 수학에 몰려 있다. 정답이 명확해 채점이 쉽기 때문이다. 그런데 내가 실제로 모델에 가장 많이 시키는 일 중 하나는 글쓰기다. 채점이 어렵다는 이유로 아무도 재지 않는 영역이, 정작 사용량이 가장 많은 영역인 셈이다. 그래서 한국어 글이 얼마나 사람처럼 자연스러운지 측정하는 벤치마크를 직접 만들었다.
Read more
LLM 벤치마크는 대부분 코딩과 수학에 몰려 있다. 정답이 명확해 채점이 쉽기 때문이다. 그런데 내가 실제로 모델에 가장 많이 시키는 일 중 하나는 글쓰기다. 채점이 어렵다는 이유로 아무도 재지 않는 영역이, 정작 사용량이 가장 많은 영역인 셈이다. 그래서 한국어 글이 얼마나 사람처럼 자연스러운지 측정하는 벤치마크를 직접 만들었다.