← BLOGAI 산업

벤치마크 순위만으로 AI 모델을 고르기 어려운 이유

공개 평가에는 선택 편향과 데이터 오염 문제가 생길 수 있다. 리더보드를 참고하면서 내 업무에 맞는 평가를 따로 마련하는 방법.

새 모델이 나오면 벤치마크 점수를 비교하게 된다. 여러 모델을 같은 문제로 평가한 결과는 후보를 좁히는 데 유용하다. 다만 그 순위가 내 제품에서도 유지될지는 별도 문제다. 사용자가 던지는 질문과 평가에 쓰인 질문이 다를 수 있기 때문이다.

점수를 해석하려면 어떤 문제를 썼는지, 모델을 몇 번 시험했는지, 실패한 결과도 공개했는지를 함께 봐야 한다.

가장 잘 나온 결과만 공개하면 생기는 편향

2025년 연구 The Leaderboard Illusion은 Chatbot Arena의 비공개 평가와 결과 공개 방식이 일부 공급사에 유리할 수 있다고 지적했다. 연구진은 Meta가 Llama 4 공개 전에 27개 비공개 모델 변형을 시험한 사례를 제시했다.

여러 변형 중 가장 좋은 결과만 공개하면, 한 번 시험한 모델과 같은 조건에서 비교하기 어렵다. 평가 표본을 얼마나 배정받았는지도 점수의 신뢰도에 영향을 준다. 이 연구를 모든 리더보드 점수가 조작됐다는 주장으로 확대할 필요는 없다. 공개 방식과 비교 조건을 확인해야 한다는 근거로 읽는 편이 정확하다.

공개된 문제는 학습에 포함될 수 있다

평가 문제나 정답이 학습 데이터에 들어가면 새로운 문제를 푸는 능력과 이미 본 답을 재현하는 능력을 구분하기 어려워진다. 이를 데이터 오염이라고 부른다.

문제가 공개돼 있다는 사실만으로 특정 모델이 정답을 학습했다고 단정할 수는 없다. 반대로 학습 종료일 뒤의 문제라고 해서 모든 오염 가능성이 사라지는 것도 아니다. 문제의 출처와 모델의 실제 학습 범위를 함께 확인해야 한다.

새 문제를 보충하고 일부 평가 항목을 비공개로 유지하면 위험을 줄일 수 있다. 모델 개선에 반복 사용한 문제와 최종 성능을 확인할 문제도 구분하는 것이 좋다.

내 제품의 평가에서는 실패 원인을 남긴다

처음에는 실제 요청 수십 개로 시작할 수 있다. 자주 들어오는 질문뿐 아니라 예외, 모호한 요청, 답할 근거가 없는 상황도 포함한다. 정답이 하나인 작업은 정답을 정하고, 글쓰기처럼 여러 결과가 가능한 작업은 지켜야 할 조건을 정한다.

모델을 바꿀 때 같은 입력으로 결과를 비교한다. 성공률 외에 응답 시간, 비용, 수정이 필요한 정도를 기록하면 어떤 선택이 운영에 유리한지 볼 수 있다.

코딩 에이전트라면 테스트 통과만 확인해서는 부족한 경우가 있다. 요구한 동작을 구현했는지, 테스트 자체를 무력화하지 않았는지, 기존 동작을 깨뜨리지 않았는지를 확인한다. 평가 기준이 실제 목적과 어긋나면 점수는 올라도 결과는 나빠질 수 있다.

공개 벤치마크와 자체 평가는 함께 쓸 수 있다. 공개 점수로 살펴볼 모델을 고르고, 실제 업무에서 원하는 결과를 내는지는 내 평가로 확인한다. 순위가 바뀔 때마다 제품 전체를 바꾸기보다 개선되는 작업이 무엇인지 먼저 확인하는 방식이다.