암호는 깨지 않았다 — 대신 AI에게 제 머릿속을 스스로 풀어보라고 속였다
1만6,000건 — 7월 24~25일 이틀간 4,000명 이상 이용자가 보낸 추론 추출 패턴 요청. 오픈AI가 9월 30일(현지시각) 블로그에서 공개한 규모 (자료 발표일 2026-09-30)
1만5,000명 — 추가 조사로 확인된 관련 활동 집단 규모. 오픈AI는 7월 28일까지 관련 재생 경로를 완전히 차단 (확인일 2026-10-04)
30만건 — 앤트로픽이 9월 위협보고서에서 밝힌 문샷AI 연계 세력의 10일간 추출 요청. 5~7월엔 2,300만건 이상의 교환을 관측 (자료 발표일 2026-09-10)
AI 챗봇에게 "너 지금 무슨 생각으로 이 답을 냈어?"라고 물으면, 요즘 모델들은 깔끔한 '생각 과정'을 보여준다. 그 생각의 원본, 그러니까 모델이 실제로 거쳐 간 추론의 흔적은 기업들이 꽁꽁 숨기는 자산이다. 9월 30일(현지시각), 오픈AI가 그걸 노린 대규모 '베끼기' 공격을 공개했다. 상대는 중국의 문샷AI다.
어떻게 암호를 깨지 않고 뺐나?
오픈AI는 모델의 내부 추론 과정을 암호화 블록 형태로 만들어 사용자 환경에 전달한 뒤 검증한다. 공격자들은 암호를 직접 깨는 대신 우회로를 탔다. 한 대화 세션에서 확보한 암호화 추론 블록을 다른 대화 세션의 프롬프트에 주입한 뒤, 모델 스스로 이를 평문으로 풀어서 재구성하도록 유도한 것이다.
오픈AI는 이번 사태를 한 모델의 출력값이나 추론 과정을 체계적으로 무단 수집해 자사 모델 학습·개선에 쓰는 '적대적 증류(Adversarial Distillation)'로 규정했다. 증류 자체는 AI 개발의 일반 기법이지만, 허가 없이 경쟁사 모델을 대상으로 하면 이용약관 위반이자 지식재산권 침해 논란으로 번진다(동아일보 보도).

오픈AI는 "사용자 대화 저장소나 데이터베이스 침해는 없었으며 핵심 암호 체계 역시 해독되지 않았다"고 확인했다. 7월 28일 관련 재생 경로를 완전히 차단하고 스트리밍 출력 검사 기능을 도입했다. 참고로 1만6,000건이라는 수치는 '시도'의 규모다. 실제 추출 성공률은 공개되지 않았다.
왜 한국의 AI 기업도 긴장하나?
공격의 '핵심 활동 집단'은 문샷AI와 연관된 인물들이 운영한 것으로 판단됐다. 다만 모든 활동이 단일 주체에서 비롯됐는지는 확인하지 못했다고 오픈AI는 선을 그었다. 문샷AI는 키미(Kimi) 개발사로, 지난 7월 자사 모델 키미 K3가 타사 모델을 무단 증류했다는 의혹을 부인한 상태다.
앤트로픽도 지난달 위협보고서에서 비슷한 공격을 공개했다. 문샷AI 연계 세력이 5,380개 위장 계정으로 10일간 약 30만 건의 추출 요청을 보냈고, 5~7월에는 2,300만 건이 넘는 교환을 관측했다는 것이다. 보안 연구진이 8월 10일 발표한 논문에서는 암호화된 추론 값을 보안 수준이 낮은 경량 모델에 입력하면 내부 사고 과정이 평문으로 노출되는 취약점도 실증됐다. 구글·오픈AI·앤트로픽은 제보 뒤 패치를 마쳤다(헤럴드경제 보도).

독자 파운데이션 모델을 상용화한 한국 테크 기업들도 API 보안 방벽 점검에 돌입했다. 이 공격의 표적은 모델의 '사고 방식' 그 자체이기 때문이다. 추론 능력이 유출되면 수천억을 들인 학습 비용을 건너뛰고 비슷한 수준의 모델을 만들 수 있다.
"우리가 우려하는 건 이용약관 위반이지 오픈 모델이나 정당한 증류가 아니다" — 오픈AI 국가안보전략 이니셔티브 책임자 캐럴라인 지어(번역, 헤럴드경제 보도)
선택 기준. AI 보안 뉴스를 볼 땐 세 가지를 따져보자. 첫째, 공격이 '시도'인지 '성공'인지 — 이번 수치는 시도 규모다. 둘째, 피해가 이용자 데이터인지 모델 자산인지 — 이번엔 이용자 데이터 침해는 없었다. 셋째, 업체가 밝힌 방어 조치(차단·패치·공유)가 구체적인지. 이 세 줄로 과장과 사실을 가를 수 있다.
AI의 뇌는 이제 국가급 자산이다. 베끼는 손은 빨라졌고, 지키는 손도 빨라져야 한다.



