← 블로그 목록
AI 뉴스3분 분량

레이저 출력 상한은 프롬프트에 적지 않는다

안전장치의 위치가 모델의 판단 안에서 모델이 넘을 수 없는 자리로 옮겨가고 있다

AX 현장에서 에이전트의 안전 문제는 대개 프롬프트에 문장을 추가하는 것으로 처리된다. "고객 데이터는 수정하지 마라", "삭제 전에 확인을 받아라" 같은 지시문이다. 이 방식의 약점은 분명하다. 지시문은 모델의 판단을 통과해야만 작동하고, 모델의 판단은 확률적이다.

지난 며칠 사이 나온 소식 셋은 같은 방향을 가리킨다. 안전을 모델의 판단에 맡기는 대신, 모델이 넘을 수 없는 자리 — 장치 드라이버, 플랫폼 기본값, 업계 공동 문서 — 에 옮겨 심는 움직임이다.

에이전트가 실험 장비를 넘겨받자, 상한은 드라이버가 쥐었다

Anthropic이 8월 27일 Model Hardware Standard(MHS) 연구 프리뷰를 공개했다. 에이전트가 실험실·제조 장비를 조작하게 하는 공유 명세다. 장비마다 전용 통합 코드를 짜느라 수 주씩 걸리던 작업을 시간 단위로 줄인다는 게 표면적 효용이지만, 설계에서 볼 지점은 안전 한계의 위치다. 레이저 출력 같은 물리 한계는 드라이버 수준에서 강제된다. 모델이 잘못 판단해도, 명세가 허용한 범위 밖의 명령은 장치에 닿지 않는다. 특정 모델 전용도 아니다 — 명세는 model-agnostic이고 MCP·CLI·API로 접근한다.

프리뷰에는 Genentech(단백질 분석 자동화), QuEra(양자컴퓨터 레이저 제어), HHMI Janelia 등이 참여했고, Universal Robots와 두산로보틱스 같은 로봇 제조사가 지지사로 이름을 올렸다. 한계도 그대로 드러났다. Genentech 사례에서 모델은 시료 거품으로 생긴 물리적 실패를 소프트웨어 버그로 오인했고, 연구자가 직접 교정해야 했다. 드라이버가 막는 것은 범위 밖의 명령이지, 범위 안의 오판이 아니다.

경쟁사 100여 곳이 "지금 보안으로는 부족하다"에 서명했다

OpenAI가 8월 27일 공개한 연서명 "A call for collective action on cyber defense"에는 Anthropic, Google, Microsoft, AWS, CrowdStrike부터 Mastercard, Visa까지 100곳 넘는 회사가 이름을 올렸다. 문서의 전제는 단순하다. 앞으로 수 개월 안에 AI 기반 공격이 훨씬 광범위하고 정교해지며, 남은 시간이 길지 않다는 것이다. 문서가 내세운 원칙은 셋이다.

  • 현행 보안 관행으로는 충분하지 않다는 사실을 인정한다
  • 더 많은 방어자에게 사이버 대응이 가능한 AI를 쥐여준다
  • 기업·정부·보안업체·AI 회사가 집단으로 대응한다

평소 벤치마크 점수로 다투던 회사들이 한 문서에 서명한 것 자체가 신호다. 어떤 회사도 자사 모델의 안전장치만으로는 이 문제를 막을 수 없다는 것을, 모델을 만드는 회사들이 먼저 인정했다.

검토 강도의 기본값은 플랫폼이 정하기 시작했다

GitHub은 9월 28일부터 Copilot 코드 리뷰의 기본 강도를 Lite에서 Balanced로 올린다. 기존·신규 저장소 전체에 적용된다. 검토를 얼마나 꼼꼼히 할지가 개별 개발자의 설정에서 플랫폼의 기본값으로 이동한 것이다. 다만 같은 공지에는 반대 방향의 기본값도 들어 있다. 통합 Copilot 경험은 기본 활성화되고, 채팅 데이터 보존 기간은 28일에서 계정 수명 전체로 늘어난다. 기본값은 개인의 선택보다 힘이 세고, 그 힘이 항상 사용자 편인 것은 아니다. 기본값을 읽는 일 자체가 검토 대상이 됐다.

조녁컴퍼니가 교육과 AX 컨설팅에서 확인하는 것도 같다. 조직에 필요한 역량은 금지 문장을 잘 쓰는 법이 아니라, 어떤 한계를 모델의 판단에 맡기고 어떤 한계를 구조에 박을지 가르는 설계 감각이다. 사업영역 →

출처

AI뉴스에이전트안전 설계

Contact

이런 교육이 필요하다면

AI·데이터 교육 도입을 검토 중이라면 카카오 오픈채팅으로 편하게 문의하세요.

Newsletter

조녁컴퍼니 뉴스레터

AI 전환과 교육 현장의 기록을 메일로 받아보세요.