싸고 빠른 모델이 늘 정답은 아니다

나는 DeepSeek V4 Flash를 메인으로 쓴다. 완벽하지 않아도 되고, 틀리면 다시 물으면 된다. 싸고 빠르다는 게 이 모델의 전부다. 그런데 같은 주에 다른 생각도 들었다. 애초에 잘못된 결정으로 시작하면 되돌리기 어렵다는 것이다.

Read more

완벽한 AI보다 충분한 AI를 고르는 것이 더 현명한 이유

모델을 고를 때 "이게 정말 최고인가"부터 묻는 사람이 많다. 하지만 최고를 쫓기 시작하면 끝이 없다. 매주 새 모델이 나오고, 벤치마크 순위는 바뀌고, 커뮤니티는 "올해의 승자"를 계속 갈아치운다. 그 속에서 나는 반대로 묻는다. 진짜 필요한 건 "완벽한 AI"인가, 아니면 "충분한 AI"인가.

Read more

남들의 평가에 휘둘리지 않고 나만의 AI 테스트를 만드는 법

모델 평가 글을 보면 잘 알려진 벤치마크 순위만 나열하고 끝나는 경우가 많다. 그 수치에 휘둘리면 실제 내 작업에서는 실망하기 쉽다. 그래서 나는 최근 나만의 테스트를 만들기 시작했다. "테스트 코드"가 아니라, 그래픽 응답의 세밀함을 확인하는 SVG 기반 문제들이다. 다리미질하는 새, 설거지하는 너구리 같은 이미지를 모델이 얼마나 정확히 재현하는지 보는 식이다.

Read more