아마존이 9월 30일 메커니컬 터크를 닫는다. 2005년에 열려 한때 50만 명 넘는 작업자가 몇 센트짜리 태스크를 처리하던 창구다. 아마존은 "프로그램과 서비스를 정기적으로 평가하고 그에 따라 조정한다"는 문장 외에 별다른 설명을 내놓지 않았다.
수요가 사라져서가 아니다. 그 창구에서 팔리던 이미지 분류, 전사, 데이터 정리는 이제 모델이 더 싸게 한다. 2023년 조사에서는 참여 작업자의 약 46%가 이미 과제를 처리하는 데 LLM을 쓰고 있었다. 사람에게 돈을 주고 사던 것을 사람이 모델로 대신 처리하고 있었다면, 그 시장은 이름만 사람 시장이었다.
그런데 사람 노동에 대한 지출은 줄지 않았다. 자리를 옮겼다.
사람값은 사라진 게 아니라 위층으로 옮겨 붙었다
같은 "데이터 라벨링"이라는 이름 아래 시간당 1달러와 200달러가 공존한다. 2026년 7월 정리된 시장 구조는 세 층으로 갈린다.
| 층 | 하는 일 | 시간당 |
|---|---|---|
| 대량 | 반복 라벨링, 비전 태스크 | $1–12 |
| 도메인 | 금융·의료·법률 전문가 | $20–85 |
| 프런티어 | RLHF·추론 평가 | $85–200+ |
메르코(Mercor)는 주간 활성 전문가 3만 명 이상, 평균 시급 85달러, 시니어는 200달러 이상이며 6월 기준 연환산 매출 20억 달러를 기록했다. 서지(Surge AI)는 약 5만 명 네트워크에 50~200달러를 지불한다. 아래층이 닫히는 동안 위층은 값이 올랐다.
차이는 손이 아니라 판정이다. 모델 출력이 맞았는지 틀렸는지 말할 수 있는 사람만 위층에 남았다.
그런데 판정 자체가 재현되지 않는다
허깅페이스가 정리한 ICML 2026 재현 해커톤이 이 지점을 드러낸다. 1,221명이 코딩 에이전트로 2,226편(전체 6,352편의 34%)을 다뤘고, 35,908개 주장을 검증해 로그북 6,816개를 남겼다.
결과는 절반이다. 51%가 최소 한 개 주장을 독립 검증받았고, 23%는 최소 한 개가 반증되거나 논쟁 중이다. 266편은 전부 검증됐고, 49편은 전부 반증됐다. 그리고 242편은 독립적으로 붙은 팀들의 결론이 서로 반대였다.
에이전트를 대량으로 붙이면 처리량이 아니라 판정의 분산이 먼저 드러난다. 이 해커톤에서 사람이 맡은 몫은 실행이 아니라 방향 설정, 가정 점검, 지각적 판단이었다. 공식 제기된 35건의 반증은 다시 적대적으로 재검증됐다. 판정에는 판정에 대한 판정이 붙는다.
사람을 붙일 자리는 검수 줄이 아니라 기준 문서다
조직이 흔히 하는 배치는 모델 뒤에 검수 인력을 세우는 것이다. 이 방식은 모델 처리량이 늘어난 만큼 인건비가 따라 늘고, 위 숫자가 말하듯 판정자를 늘려도 결론이 갈린다. 242편의 상반된 판정은 사람이 부족해서 생긴 게 아니라 기준이 공유되지 않아 생긴다.
기준을 문서로 고정하면 재현성은 오르지만 기준 밖 사례를 놓친다. 그래서 판정 기준에는 항상 예외를 어디로 올릴지가 함께 적혀야 한다. 이 둘을 쓰는 일이 지금 시간당 200달러에 팔리는 노동의 실체다.
조녁컴퍼니가 AX 교육에서 붙잡는 지점도 같다. 도구 사용법보다, 조직의 판정 기준을 누가 어떤 형태로 쓰고 누가 예외를 받는지가 남는다. 사업영역 →