← 블로그 목록
AI 뉴스4분 분량

출제자도 응시자도 서로의 봉투를 열 수 없게 됐다

구글 딥마인드의 이중 맹검 평가, 앤스로픽의 '포화된' 평가, 깃허브의 리뷰 해결 사유가 가리키는 한 방향

모델 도입 검토 회의에는 벤치마크 점수표가 한 장씩 돈다. 그 점수를 누가, 어떤 문제로, 어떤 조건에서 냈는지 묻는 사람은 드물다. 벤더가 낸 수치든 외부 기관이 낸 수치든, 표에 적히는 순간 같은 무게를 갖는다.

그런데 외부 기관이 독점 모델을 시험하는 방법은 지금까지 하나였다. 벤더 API에 문제를 넣는 것이다. 문제지는 벤더 서버에 평문으로 도착한다. 이걸 막는 장치는 무로깅 약정과 비밀유지 계약이었다. 약속이지 구조가 아니다. 그 문제가 다음 학습 데이터에 섞이지 않았다는 걸 증명할 방법은 없었다.

이번 주 이 약속이 구조로 바뀌기 시작했다.

문제지가 계약 문서에서 암호화된 GPU로 옮겨갔다

구글 딥마인드는 8월 27일 Gemini 2.5 Flash Lite를 이중 맹검으로 평가한 결과를 공개했다. 평가자(AVERI, 싱가포르 AI안전연구소)는 모델 가중치를 보지 못하고, 구글은 평가자의 프롬프트를 보지 못한다. 양쪽 자산은 Intel TDX와 NVIDIA H100 기밀 GPU로 격리된 Google Cloud Confidential Space 안에서만 복호화된다. 벤더가 모의 인터페이스를 공개하면 평가자가 그걸로 문제와 채점 코드를 만든다. 양쪽이 각자 하드웨어 원격 증명을 검증한 뒤에야 가중치와 문제지가 TLS로 엔클레이브에 들어간다. 나오는 건 집계 지표뿐이고, 엔클레이브는 폐기된다.

자산구글평가자엔클레이브
가중치·추론 코드보유못 봄복호화 후 실행
문제지못 봄보유복호화 후 실행
결과없음집계 지표만평가 후 폐기

문제지는 MLCommons AILuminate의 예비 세트, 즉 어떤 모델도 처리한 적 없는 프롬프트에서 뽑았다. 기술 보고서가 인용한 선행 연구는 검사한 31개 모델 중 절반가량에서 사전·사후학습 단계의 벤치마크 유출을 확인했다. 이번 발표는 점수를 공개하지 않았다. 산출물은 점수가 아니라 절차다.

봉투는 완전하지 않다. 보고서 스스로 세 가지를 적었다. Gemini의 독점 추론 코드 일부는 검사·허용목록에 넣지 못했고 AVERI가 이를 알고 수용했다. Confidential Space 게스트 OS 빌드는 비공개 서명키가 입력이라 독립 재현이 안 된다. 증명서 서명과 검증을 구글 서비스가 맡아 구글이 검증 경로 안에 있다. MLCommons도 평가 비밀 유지만으로는 충분하지 않다고 썼다. 보고서의 결론은 병목이 이제 하드웨어가 아니라 법률 계약과 코드 검토에 드는 인적 조정이라는 것이다.

점수가 포화된 곳에서 남는 신호는 절차다

이 구조가 왜 지금 필요한지는 앤스로픽이 8월 14일 낸 리스크 보고서가 설명한다. 가장 구체적인 과제형 평가가 "포화"됐다고 적었다. 모델 능력이 늘어도 점수가 오르지 않는다. 그래서 연구개발 자동화 위험에 대한 확신은 이전보다 낮아졌고, 오정렬 위험 등급은 '매우 낮음'에서 '낮음'으로 올렸다. 새 발견이 아니라 불확실성 때문이다. 새 모델이 어떤 평가에서 더 나쁘게 나오면 모델보다 평가를 의심하겠다는 문장도 있다. 모델이 평가 상황임을 알아채는 빈도가 생각보다 높을 수 있다는 절도 따로 붙었다.

점수가 능력을 반영하지 않고, 문제가 유출되고, 모델이 시험임을 안다면 남는 신호는 절차다. 누가 문제를 냈고, 그 문제가 이전에 어떤 모델을 거쳤고, 누가 채점했는가. 허깅페이스가 8월 28일 Open ASR 리더보드에 힌디어와 인도 영어를 추가하며 택한 방식이 그 예다. 자체 채점용 공개 분할과 리더보드 최적화를 막는 비공개 분할을 나눴고, 정답 전사는 어떤 공개 리더보드에도 오르지 않은 내부 모델로 만들었다. 평가받는 시스템이 자기 정답지를 쓰는 일을 막은 것이다. 인도 영어에서 8개 모델의 오류율은 4.81~4.99로 붙어 있지만, 지역별로 쪼개면 한 모델은 0.46점, 다른 모델은 1.68점 벌어진다. 합계 한 줄로는 보이지 않는다.

코드 리뷰어도 심사 대상이 됐다

같은 흐름이 개발 도구에도 있다. 깃허브는 8월 27일 Copilot 코드 리뷰에 '해결 사유'를 넣었다. 리뷰 코멘트를 닫을 때 반영함, 고치지 않음, 틀림 중 하나를 고른다. 사람이 리뷰어를 채점하는 기록이다. 같은 날부터 봇이 만든 PR도, Copilot 클라우드 에이전트가 만든 PR도 전체 에이전트 리뷰를 받는다. 300개 파일·2만 줄 한도는 없어졌다. 기계가 쓴 코드를 기계가 심사하고, 사람은 그 심사의 판정 이유를 남기는 구조다.

하나 더. 9월 28일부터 리뷰 기본 강도가 Lite에서 Balanced로 바뀐다. 설정을 만지지 않은 팀의 리뷰 결과가 그날 바뀐다. 리뷰 지적 건수를 지표로 보던 팀은 조건이 바뀐 걸 기록하지 않으면 전후 비교가 무효가 된다.

도입 검토 회의의 점수표에는 이제 네 줄이 더 붙어야 한다.

  • 문제를 누가 냈고, 이전에 어떤 모델을 거쳤는가
  • 채점자는 누구이고, 무엇을 볼 수 있었는가
  • 벤더는 무엇을 볼 수 있었는가
  • 조건이 바뀌었을 때 전후 비교가 가능한가

조녁컴퍼니가 AX 교육에서 가르치는 것도 점수를 읽는 법이 아니라 그 점수가 나온 절차를 묻는 법이다. 사업영역 →

출처

AI뉴스AI 평가벤치마크

Contact

이런 교육이 필요하다면

AI·데이터 교육 도입을 검토 중이라면 카카오 오픈채팅으로 편하게 문의하세요.

Newsletter

조녁컴퍼니 뉴스레터

AI 전환과 교육 현장의 기록을 메일로 받아보세요.