모델이나 프롬프트를 바꿀 때마다 결과를 모두 사람이 검토하기는 부담스러울 수 있다. 이때 다른 AI에 답변을 평가하게 하는 LLM-as-judge 방식을 쓸 수 있다. 반복 평가를 빠르게 수행할 수 있지만 평가 모델의 판단도 검증해야 한다.
순서와 길이가 점수에 영향을 줄 수 있다
MT-Bench와 Chatbot Arena 연구는 LLM 평가에서 위치 편향, 장황함 편향, 자기 선호 같은 한계를 다뤘다. 답변 내용이 같아도 제시 순서나 표현 방식에 따라 평가가 달라질 수 있다는 것이다.
모든 모델이 언제나 첫 번째 답을 고르는 것은 아니다. 어떤 방향으로 얼마나 영향을 받는지는 모델과 과제에 따라 다르다. 평가하려는 작업에서 직접 확인해야 한다. 사람의 평가에도 편향과 의견 차이가 있으므로, 인간 판단을 비교 기준으로 쓸 때 역시 기준을 분명히 해야 한다.
좋은 답의 조건을 나눈다
“어느 답이 더 좋은가”만 물으면 평가 모델의 선호가 크게 개입할 수 있다. 사실을 잘못 썼는지, 요청한 조건을 지켰는지, 필요한 내용을 빠뜨렸는지 등 판단 항목을 나누면 무엇을 평가하는지 더 명확해진다.
정해진 형식이나 필수 필드처럼 코드로 확인할 수 있는 항목은 자동 검사로 처리할 수 있다. 글의 자연스러움이나 설명의 충분함처럼 판단이 필요한 부분은 모델과 사람의 검토를 활용한다.
정확한 답이 여러 개일 수 있는 작업에서는 하나의 예시 문장과 얼마나 비슷한지만 재지 않는다. 다른 표현으로도 요구사항을 충족할 수 있어야 한다.
평가 모델부터 시험한다
사람이 검토한 표본을 준비하고 평가 모델이 얼마나 일치하는지 본다. 전체 일치율뿐 아니라 틀린 답을 통과시키는 경우와 좋은 답을 떨어뜨리는 경우를 나눠 확인하면 위험을 더 구체적으로 볼 수 있다.
두 답변을 비교한다면 순서를 바꿔 다시 평가할 수 있다. 결과가 뒤집히는 항목은 판단이 불안정하다는 신호다. 중요한 항목은 사람이 확인하고, 점수를 합칠 때도 이런 차이를 숨기지 않는 편이 좋다.
답변 길이의 영향도 점검한다. 긴 답이 필요할 수 있으므로 무조건 짧게 만들거나 길이에 벌점을 주는 방식은 목적과 어긋날 수 있다. 요청에 필요한 내용과 불필요한 반복을 구분해서 평가한다.
다른 모델을 쓰는 것만으로 끝나지는 않는다
생성 모델과 다른 계열의 모델을 평가에 쓰면 일부 자기 선호 위험을 줄이는 데 도움이 될 수 있다. 하지만 다른 모델도 비슷한 편향을 공유하거나 같은 사실을 잘못 알 수 있다. 공급사를 바꾸는 것만으로 중립적인 평가가 보장되지는 않는다.
평가 기준이나 모델이 바뀌면 사람의 판정과 다시 비교한다. 실제 사용자에게 중요한 오류를 놓치고 있지 않은지도 정기적으로 확인한다. 평가 점수가 올라가는 것과 사용자가 더 좋은 결과를 받는 것이 연결돼야 자동 평가를 믿고 활용할 수 있다.