← 블로그 목록
AI 뉴스6분 분량

Anthropic 에이전트 3만 개의 사후 기록 중 사람이 읽는 건 주 50건이다, 감독은 검토 인원이 아니라 커버리지로 잰다

'최종 검토는 사람이 한다'를 숫자 세 개로 바꿔 적는 법

Anthropic이 사내 에이전트 약 3만 개의 감독 수치를 9월 17일 공개했다. 모든 행동이 실행 전 모니터를 거치고, 사람이 읽는 사후 기록은 주 50건이다. 우리 에이전트의 커버리지·검토 지연·에스컬레이션 비율부터 재야 한다.

에이전트 도입 계획서에는 거의 빠짐없이 "최종 검토는 사람이 한다"는 문장이 들어간다. 파일럿 단계에서는 맞는 말이다. 개발자 한 명이 에이전트 하나를 띄우고, 도구 호출마다 승인 창을 누른다.

문제는 호출량이 사람의 승인 속도를 넘는 순간이다. 에이전트가 하루 수천 번 셸과 MCP 도구를 부르면 그 문장은 지켜졌는지 확인할 방법이 없는 약속이 된다. 이번 주 Anthropic이 자기 회사 안에서 이 문제를 어떻게 다루는지 숫자로 내놨다.

3만 개 규모에서 감독을 떠받치는 것은 사람이 아니라 실행 전 모니터다

Anthropic 9월 17일 공개 지표에 따르면 8월 기준 Anthropic 사내 플랫폼에서는 연구·엔지니어링 에이전트 약 3만 개가 동시에 돈다. Anthropic은 이들의 감독을 세 숫자로 보고했다. 커버리지는 행동 중 모니터를 거치는 비율, 검토 지연은 행동에서 자동 검토와 사람 검토까지 걸린 시간, 에스컬레이션 비율은 차단되거나 추가 검토로 넘어간 비율이다.

구분커버리지검토 지연에스컬레이션 비율
온라인 모니터(실행 전)행동 100%자동 검토는 보통 수 초, 차단 건의 사람 검토는 1주 이내8월 10억 건 이상 중 0.002%(약 4만 7천 건에 1건) 차단
오프라인 모니터(실행 후)행동 100% 수집주 약 10만 건 플래그를 분류기가 거른 뒤 약 50건을 사람에게기록 1천 건당 1~2건 플래그

숫자를 이으면 구조가 보인다. 10억 건의 0.002%면 한 달 차단이 2만 건을 넘는다. 오프라인 쪽은 플래그 10만 건 중 사람에게 가는 것이 약 50건, 2천 건에 1건꼴이다. 실시간 방어는 수 초 안에 끝나는 자동 검사가 맡고, 사람의 1주는 그 검사가 맞았는지 보는 시간이다.

사람이 모든 행동을 본다는 약속은 이 규모에서 성립하지 않는다. 남는 약속은 모든 행동이 무언가를 거친다는 것이다.

커버리지 100%는 모니터 성능보다 에이전트 설계에서 나온다

Anthropic은 이 커버리지를 가능하게 한 설계 두 가지를 꼽았다. 에이전트마다 지속되는 개별 신원을 주고, 그 에이전트가 만든 모든 데이터를 신원에 묶는다. 에이전트끼리는 비공개 채널 대신 공유 메시징으로 소통한다. 어떤 행동이 누구의 것인지 가를 수 없으면 비율의 분모부터 세지 못한다. 에이전트에게도 사번이 필요하다에서 다룬 문제가 여기서 측정의 전제로 돌아왔다.

고객 쪽 계기판은 아직 이 분모를 주지 않는다. GitHub 9월 17일 공지로 Copilot 사용량 지표 API에 totals_by_mcp, totals_by_skill 같은 필드가 생겼다. 그러나 MCP 수치는 연결 시도에서만 오르고, 연결된 서버의 도구 호출은 세지 않는다. 고객이 만든 서버·스킬 이름은 개인정보 보호를 이유로 other로 묶인다. 도입 추이는 보이지만 어떤 호출이 검사를 거쳤는지는 보이지 않는다.

직접 잴 도구는 이미 있다. Claude Code 훅 문서 기준으로 PreToolUse 훅은 실행 전에 도구 호출을 막을 수 있고, mcp__.* 패턴으로 MCP 도구 전체에 걸린다. Claude Code 모니터링 문서의 OpenTelemetry 이벤트는 실행된 호출(claude_code.tool_result)과 거절(claude_code.tool_decision)을 따로 남기고, OTEL_LOG_TOOL_DETAILS=1이면 MCP 서버·도구 이름까지 기록한다. 훅이 덮는 도구 이름과 실제 호출된 도구 이름을 대조하면 커버리지가 나온다.

자체 보고 숫자의 한계는 Anthropic도 인정한다. Anthropic 9월 18일 Accenture 제휴 발표는 직원에 준하는 접근권을 가진 외부 평가자를 회사 안에 두는 '임베디드 평가'를 시작한다는 내용이다. 두 회사는 5년간 각각 최소 10억 달러를 이 역량에 쓸 계획이다. Anthropic은 외부 평가자가 자사 책임을 줄이지 않고 검증 가능하게 만든다고 적었다. 우리 조직의 세 숫자도 에이전트를 운영하는 팀이 아닌 쪽이 한 번은 확인해야 한다.

가져갈 것

Anthropic 수치를 기준선으로 두고, 우리 쪽 Claude Code·Copilot 사용분에서 다음 다섯 칸을 채운다.

확인 항목어디서 확인하나기한
커버리지: 도구 호출 중 실행 전 검사를 거친 비율 (기준선 100%).claude/settings.jsonPreToolUse matcher(Bash·Edit·Write·mcp__.*)와 claude_code.tool_result의 도구 이름 대조, OTEL_LOG_TOOL_DETAILS=1 필요9월 25일(금)
에스컬레이션 비율: 훅·설정이 거절한 호출 비율 (기준선 0.002%)claude_code.tool_decision 거절 건 중 decision_sourcehook·config인 것 ÷ 전체 호출9월 25일(금)
검토 지연: 거절 건을 사람이 확인하기까지 걸린 시간 (기준선 1주 이내)거절 이벤트 시각과 담당자 확인 기록(티켓·채널 메시지)의 시간 차10월 2일(금)
에이전트 신원: 호출을 개발자 개인과 에이전트로 가를 수 있는가에이전트 전용 토큰·서비스 계정 발급 대장, OpenTelemetry 이벤트의 세션·사용자 속성10월 2일(금)
Copilot 공백: MCP·스킬 사용이 other 한 줄로 합쳐지는가Copilot usage metrics API의 totals_by_mcp·totals_by_skill (사용량 지표 정책 켜짐, 소유자 또는 View Copilot Metrics 권한)9월 25일(금)

안 되는 경우

  • 몇 명이 에이전트를 대화형으로만 쓰고 호출마다 승인 창을 누르는 단계라면, 사람의 승인 창이 곧 실행 전 모니터다. 세 숫자는 호출량이 사람의 승인 속도를 넘을 때 쓸모가 생긴다.
  • 0.002%가 낮은 이유가 에이전트가 얌전해서인지 모니터가 둔해서인지 이 자료로는 가를 수 없다. Anthropic은 알려진 오작동을 모니터가 얼마나 잡는지 공개하라고 권하지만 이번 글에 그 수치는 없고, METR 레드팀은 과거에 했다는 한 문장뿐이다.
  • 모든 수치는 Anthropic 자체 보고이고 8월 기준이다. Anthropic 스스로 이 모니터링을 "수년이 아니라 수개월" 해 왔다고 밝혔다.
  • Accenture 임베디드 평가는 발표 단계이고, 첫 검증 결과를 언제 공개하는지는 밝히지 않았다.

이번 주에 바꿀 것은 문장 하나다. 에이전트 도입 문서의 "최종 검토는 사람이 한다"를 "도구 호출의 몇 %가 실행 전 검사를 거친다"로 고쳐 적는다. 그 숫자를 채우지 못하면 칸을 비워 둔 채 회의에 올린다. 빈 칸이 다음 분기의 작업 목록이다. 사업영역 →

출처

AI뉴스에이전트 감독AI 거버넌스

Contact

이런 교육이 필요하다면

AI·데이터 교육 도입을 검토 중이라면 카카오 오픈채팅으로 편하게 문의하세요.

Newsletter

조녁컴퍼니 뉴스레터

AI 전환과 교육 현장의 기록을 메일로 받아보세요.