OpenAI 연구조직은 사람 하루당 3.1 에이전트-워크데이를 쓴다. 중앙값 연구자 한 명의 하루 추론비는 API 정가로 600달러가 넘는다. 도입률 대신 이 두 숫자를 우리 청구서와 실행 로그에서 재면 된다.
AI 도입 성과 자료에 가장 자주 올라오는 숫자는 발급 계정 수와 주간 사용률이다. 둘 다 사람을 센다. 사람을 세는 지표는 전원이 한 번씩 로그인한 시점에 천장에 닿고, 그 뒤로는 조직이 나아졌는지 나빠졌는지 아무것도 말해주지 않는다.
9월 6일 OpenAI가 자기 연구조직에 붙인 숫자는 종류가 다르다. 사람이 아니라 사람 옆에서 돌아간 작업의 양을 셌고, 거기 든 돈을 1인 하루 단위로 붙였다. 이 두 값은 전원 도입이 끝난 뒤에도 계속 움직인다.
3.1은 모델 점수가 아니라 사람 한 명이 감당한 작업량이다
OpenAI 9월 6일 보고서는 8월 중순 기준으로 연구조직이 사람의 하루(8시간)당 3.1 에이전트-워크데이에 해당하는 작업을 쓴다고 밝혔다. 분모는 사람의 근무시간이고 분자는 에이전트가 실제로 돌아간 시간이다. 올해 앞부분에는 이 값이 1 아래였다. 같은 인원, 같은 근무시간에서 분자만 늘어난 것이다.
두 번째 숫자가 더 실무적이다. 중앙값 연구자는 API 정가 기준 하루 600달러가 넘는 추론을 쓰고, 상위 10%는 7,000달러를 넘긴다. 같은 도구와 같은 권한을 쥔 사람들 사이에서 열 배 넘는 격차가 났다는 뜻이다. 이 격차는 라이선스로 메워지지 않는다.
에이전트를 몇 배로 돌릴 수 있느냐는 모델을 무엇으로 바꾸느냐가 아니라, 동시에 던질 수 있는 과제를 몇 개나 정의해 두었느냐가 정한다.
이 비율의 상한은 예산이 아니라 과제 정의가 정한다
OpenAI는 이 상태를 "숙련 연구자가 며칠 걸릴, 잘 정의된 과제를 수행하는" 자동화된 연구 인턴이라고 부른다. 무게는 '잘 정의된'에 실려 있다. 보고서 스스로도 에이전트 산출물에 상위 수준의 계획은 거의 없고 사람의 조종이 여전히 많이 필요하다고 적었다. 3.1은 사람이 빠진 자리의 크기가 아니라, 사람 한 명이 던지고 받아 검토할 수 있었던 일감의 크기다.
가격은 이미 그 상한을 밀어 올리는 쪽으로 움직였다. VentureBeat 9월 초 보도에 따르면 Anthropic은 Fable 5.1과 함께 캐시 읽기 단가를 100만 토큰당 1.00달러에서 0.25달러로 내렸고, 에이전트 성격이 강한 작업에서 최대 45% 절감을 제시했다. 같은 코드베이스와 같은 지침을 반복해 읽는 실행일수록 이득이 크다. 동시 실행 개수를 늘리려던 팀이 먼저 확인할 항목이다.
권한 쪽도 같은 방향이다. GitHub 9월 4일 체인지로그는 Copilot 앱과 CLI가 콘텐츠 제외 설정을 지키게 됐다고 알렸다. 제외가 지켜지지 않는 동안 보안팀이 막아둔 저장소는 애초에 에이전트에게 열리지 않았다. 비율을 올리려면 과제 정의와 열어줄 수 있는 범위가 같이 늘어야 한다.
AI 성과 회의에 이제 병합 기록을 들고 들어간다에서 다룬 병합 기록이 결과 쪽 눈금이라면, 3.1과 600달러는 투입 쪽 눈금이다. 둘 중 하나만 있으면 회의는 다시 인상 소감으로 돌아간다.
가져갈 것
| 확인 항목 | 어디서 확인하나 | 기한 |
|---|---|---|
| 최근 4주 에이전트 실행 시간 합계 ÷ (참여 인원 × 8시간 × 근무일) | 벤더 콘솔의 세션·사용량 로그, CI 잡 실행 시간 | 9월 30일 |
| 1인 하루 추론비의 중앙값과 90퍼센타일 (정가 환산 아닌 실제 청구액) | API 청구 명세, 사내 LLM 게이트웨이 사용량 | 9월 30일 |
| 캐시 읽기 단가 1.00달러 → 0.25달러가 우리 청구서에 반영됐는지 | 청구 명세의 cache read 항목, 사용 모델 버전 | 10월 첫 청구서 |
| "숙련자가 며칠 걸릴 잘 정의된 과제" 목록이 문서로 존재하는지 | 이슈 트래커 또는 팀 위키의 과제 템플릿 | 10월 15일 |
| Copilot 앱·CLI의 콘텐츠 제외 설정이 실제로 적용되는지 | 조직·저장소 Copilot 정책 화면 | 9월 30일 |
안 되는 경우
- 산출물이 코드와 실험으로 떨어지는 조직에서 나온 숫자다. 영업·법무처럼 결과물이 문서와 협상인 조직은 분자(에이전트 실행 시간)의 정의부터 다시 잡아야 한다.
- 보고서는 이 비율이 연구 성과를 실제로 앞당겼는지는 주장하지 않는다. 3.1은 투입 지표이지 결과 지표가 아니다.
- 600달러와 7,000달러는 API 정가로 환산한 값이다. 자체 인프라나 할인 계약을 쓰는 조직의 청구서 숫자가 아니다.
- 사람의 조종이 여전히 많이 필요하다고 같은 보고서가 밝혔다. 인원 감축의 근거로는 쓸 수 없다.
이번 주에 바꿀 것은 한 줄이다. 다음 AI 회의 자료에서 "사용률 %" 한 줄을 지우고, 사람 하루당 에이전트 작업일수와 1인 하루 추론비 두 줄로 바꿔라. 두 숫자가 안 나오면 로그와 청구서가 없는 것이고, 그 자체가 이번 달에 먼저 해결할 과제다. 교육이든 컨설팅이든 그다음 순서다. 사업영역 →