← BLOGAI 산업

AI 에이전트가 긴 작업을 끝낼 확률을 어떻게 볼까

METR의 작업 시간 지평은 전문가 기준 작업 길이와 AI의 성공 확률을 연결한 지표다. 이 수치를 실제 자동화 범위에 적용할 때 주의할 점.

짧은 작업을 한 번 잘 마쳤다고 해서 긴 업무를 통째로 맡겨도 되는 것은 아니다. 여러 도구를 차례로 호출하고 중간 결과를 보존해야 하는 작업에서는 뒤의 단계까지 정확히 이어가는 능력이 필요하다.

이 차이를 살펴볼 수 있는 지표가 작업 시간 지평이다. 사람이 몇 분 또는 몇 시간 걸리는 일을 AI가 어느 확률로 끝내는지 측정한다.

‘두 시간짜리 작업’의 뜻

METR의 2025년 연구는 전문가가 수행하는 데 걸리는 시간을 기준으로 작업 길이를 정하고, AI가 50% 확률로 완료하는 지점을 추정했다. 연구 대상 모델의 이 지표는 2019년부터 2025년 초까지 약 7개월마다 두 배로 늘어나는 추세를 보였다.

이때 시간은 AI가 실제로 실행한 시간이 아니다. 사람이 처리할 때 두 시간이 걸리는 작업이라는 뜻이다. 또한 주로 소프트웨어와 관련된 평가 결과를 모든 직종의 업무로 그대로 확대할 수는 없다.

50%라는 성공 확률도 함께 읽어야 한다. 절반 정도 성공하는 작업을 별도 확인 없이 운영에 맡겨도 된다는 뜻은 아니다. METR의 지표 설명은 50%와 80% 시간 지평을 구분한다. 어느 신뢰 수준이 필요한지는 실패했을 때의 영향에 따라 달라진다. 결제나 데이터 삭제처럼 되돌리기 어려운 일에서는 80%도 충분하지 않을 수 있다.

단계가 많아질 때 생기는 문제

각 단계가 독립적으로 95% 확률로 성공한다고 가정하면, 20단계를 모두 통과할 확률은 약 36%다. 단계별 성공률이 99%라면 약 82%가 된다. 간단한 계산이지만 작은 오류가 긴 작업의 완료율에 영향을 줄 수 있음을 보여준다.

실제 에이전트에서는 실패가 독립적이지 않다. 처음 잘못 이해한 내용을 뒤에서 계속 사용할 수도 있고, 반대로 오류를 발견해 복구할 수도 있다. 따라서 이 계산을 제품의 실제 성공률로 삼을 수는 없다. 처음부터 끝까지 수행한 결과를 따로 측정해야 한다.

자동화 범위를 정하는 방법

긴 업무를 나눌 때는 단계 수만 줄이기보다 중간 결과를 확인할 수 있는 지점을 찾는다. 자료 수집, 판단, 외부 실행이 나뉘는 업무라면 각 결과를 저장하고 다음 단계의 입력이 맞는지 확인할 수 있다.

실패한 작업이 어디까지 진행됐는지 남겨두면 처음부터 반복할 필요도 줄어든다. 사람이 확인할 부분은 모든 단계에 일괄적으로 넣기보다 오류의 영향이 크거나 자동 검증이 어려운 곳에 둔다.

운영 지표에는 전체 완료율과 함께 재시도 횟수, 사람이 개입한 비율, 실패 후 복구 시간을 남기는 편이 좋다. 한 번 성공한 데모에서는 보이지 않던 부담을 확인할 수 있다.

시간 지평 연구는 모델 발전을 보는 데 유용하다. 오늘 내 업무에서 어디까지 자동화할지는 그 업무를 실제로 반복 실행한 결과로 정해야 한다.