AI 산업을 칩, 모델, 앱으로만 나누면 학습 자료를 만들고 결과를 평가하는 일을 놓치기 쉽다. 모델이 제시한 답 중 어느 것이 더 나은지 판단하고, 특정 분야의 정확한 예시를 만드는 데는 사람의 지식이 필요하다.
2025년 6월 Scale AI는 Meta의 대규모 투자를 발표했다. 발표에서 기업가치는 290억 달러 이상으로 제시됐고, 창업자 Alexandr Wang이 Meta의 AI 업무에 합류한다고 밝혔다. 데이터와 평가 인력이 AI 경쟁에서 중요한 자산으로 취급된 사례다.
학습 자료에도 전문성이 필요하다
일반적인 문장을 분류하는 일과 법률 문서의 오류를 찾는 일은 다르다. 복잡한 분야에서는 답을 평가할 사람의 전문성과 일관된 기준이 중요하다. 같은 문제에서도 조건을 놓치면 그럴듯한 오답을 좋은 예시로 남길 수 있다.
자료의 양뿐 아니라 누가 어떤 기준으로 판단했는지 확인할 수 있어야 한다. 평가자 사이의 의견 차이를 검토하고, 잘못된 라벨을 수정하며, 민감한 정보를 다루는 절차도 필요하다.
주요 고객과 투자자가 겹칠 때
여러 모델 개발사에 서비스를 제공하는 데이터 회사가 그중 한 곳의 투자를 받으면 다른 고객은 정보의 취급 범위를 다시 확인할 수 있다. 투자사의 접근 권한과 사업 영향력, 계약상 보호 장치가 관심사가 된다.
이것은 투자를 받으면 중립성이 반드시 사라진다는 뜻은 아니다. 지분 구조만으로 실제 정보 유출이나 고객 이탈을 단정할 수도 없다. 고객 데이터를 누가 볼 수 있고 어떤 용도로 쓰는지에 대한 운영과 계약을 봐야 한다.
Scale AI의 거래를 단순히 “사들이는 순간 가치가 사라졌다”고 설명하면 이런 조건을 생략하게 된다. 투자로 얻는 자원과 다른 고객이 느끼는 이해상충을 함께 살펴보는 편이 정확하다.
작은 데이터 사업에서도 생기는 문제
경쟁 관계에 있는 고객들의 자료를 다루는 회사라면 고객별 접근 권한과 자료 분리, 재사용 범위를 명확히 해야 한다. 한 고객의 미공개 자료를 다른 고객의 결과물에 사용하는 것은 품질 문제를 넘어 신뢰 문제로 이어질 수 있다.
업무 기록과 검토 이력도 중요하다. 요청한 작업이 어떤 자료를 사용해 만들어졌는지 설명할 수 있어야 문제가 생겼을 때 확인하고 수정할 수 있다.
AI 학습 데이터의 가치는 라벨을 붙이는 속도만으로 정해지지 않는다. 필요한 판단을 정확히 제공하고, 여러 고객이 맡긴 정보를 일관된 기준으로 관리하는 능력도 사업의 일부다.