

- 신영선의 AI탐구
- 조코딩 JoCoding
- CONNET AI LAB
- 편집자P
- 필로소피AI
- 코드팩토리
- 코난쌤
- 메타코드M
- 개발동생
- 메이커에반
- 바이브랩스
- 단테랩스
- 괴발자
- 홍정모AI
- 한빛미디어
- 칼퇴왕김과장N8N
- 퀀텀점프클럽N8N
- 짐코딩
- 시현의모험
- AI겸임교수 이종범
- AI ON
- 태오의실행비즈니스
- 오후다섯씨
- 코드깎는노인
- 데브남
- 스테판초 AI
- 빌더조쉬
- Claudical (클로디컬)
- 테크브릿지
- 실밸개발자
- Ai 서대표
- 일하는 Ai
- 시민개발자 구씨
- 일잘러 장피엠
- 이동훈의 루트ai
- 조태호교수
- 아는개발자 캐슬
- Jay Choi 인디해커
- 기술노트with일렉
- 제초초토크
- Ai IMPACT
- 오늘노트
- 알쓸신작 AI 이야기
- AI 튜터랩
- CODE DECK ★ 중요함
- 샘호트만 AI엔지니어
- 테디노트
- 경희대학교 SW사업단
- 강원대학교 SW사업단
- 지투지 AI STUDY
- 바퍼
- 소스놀이터
앤트로픽, 딥시크 등 3개 AI 연구소의 대규모 불법 모델 증류 공격 적발
## 앤스로픽의 모델 증류 공격 적발 및 개요
앤스로픽은 최근 딥시크, 문샷 에이아이, 미니맥스라는 세 곳의 인공지능 연구소에서 조직적이고 산업적인 규모로 자사의 인공지능 모델인 클로드를 표적으로 삼은 불법적인 모델 증류 공격 캠페인을 감행한 사실을 적발했습니다. 이들 연구소는 앤스로픽의 서비스 약관 및 지역 접근 제한 조치를 명백히 위반하면서, 약 2만 4천 개에 달하는 대규모 사기 계정을 무단으로 생성하고 이를 통해 1천 6백만 회 이상의 상호작용을 발생시켜 클로드의 핵심 성능과 기능을 불법적으로 추출하려 시도했습니다. 이러한 공격의 배후에 있는 증류 기술은 본래 성능이 뛰어난 대형 모델의 결과물을 활용하여 고객들을 위해 더 작고 저렴한 버전을 만드는 등 인공지능 업계에서 합법적이고 널리 쓰이는 훈련 방식입니다. 하지만 경쟁사들이 이를 불법적인 목적으로 악용할 경우, 자체적으로 모델을 개발하는 데 소요되는 막대한 시간과 비용의 아주 적은 일부분만 들이고도 다른 연구소의 강력한 인공지능 기술력을 손쉽게 탈취할 수 있게 되는 심각한 문제가 발생합니다.
## 모델 증류 기술의 악용이 초래하는 보안 및 정책적 위협
불법적인 방식으로 증류된 모델이 초래하는 가장 큰 위험은 모델 내부에 필수적으로 존재해야 할 안전장치들이 심각하게 훼손되거나 완전히 누락된다는 점에 있습니다. 현재 미국 기업들은 국가 및 비국가 행위자들이 인공지능을 악용해 생물학 무기를 개발하거나 악의적인 사이버 공격 활동을 수행하지 못하도록 강력한 방어 시스템을 구축해오고 있으나, 증류된 모델에서는 이러한 보호 조치들이 모두 제거된 상태로 위험한 기능들만이 무분별하게 확산될 수 있습니다. 특히 이러한 방식으로 미국의 인공지능 모델을 탈취한 해외 연구소들이 해당 기술을 자국의 군사, 정보 수집, 감시 시스템에 통합할 경우, 권위주의적인 정부가 사이버 공격이나 대규모 허위 정보 유포 캠페인, 광범위한 대중 감시에 이를 직접적으로 악용할 수 있는 국가 안보 차원의 중대한 위협이 됩니다. 이뿐만 아니라 해당 모델들이 오픈소스의 형태로 외부에 완전히 공개되어 버린다면 그 위험성은 단일 정부의 통제 범위를 넘어 전 세계로 걷잡을 수 없이 퍼져나가게 됩니다. 아울러 이러한 공격은 미국의 수출 통제 정책 근간을 뒤흔드는 결과를 초래합니다. 공격에 대한 실질적인 정보가 부재할 경우 해외 연구소들이 단기간에 이룩한 표면적인 기술 발전이 그 자체로 수출 통제 정책의 실패나 혁신을 통한 우회 성공으로 잘못 해석될 여지가 있습니다. 하지만 이들의 실질적인 기술적 진보는 상당 부분 미국 모델에서 불법적으로 추출된 능력에 의존하고 있으며, 대규모 증류를 위해서는 결국 첨단 칩에 대한 접근이 필수적이므로 이는 칩 접근을 제한하는 수출 통제의 필요성을 오히려 더욱 강력하게 뒷받침해줍니다.
## 주요 공격 주체별 분석과 구체적인 탈취 시도
가장 먼저 딥시크는 15만 회 이상의 상호작용을 통해 클로드의 다양한 추론 능력과 강화 학습을 위한 보상 모델 기능 등을 집중적으로 표적으로 삼았습니다. 이들은 탐지를 피하기 위해 여러 계정 간의 트래픽을 정교하게 동기화하고 로드 밸런싱 기법을 사용해 처리량을 늘렸으며, 클로드가 응답의 내부 추론 과정을 단계별로 상세히 작성하도록 유도하여 대규모 연쇄 추론 훈련 데이터를 생성했습니다. 또한 반체제 인사나 권위주의와 같은 민감한 질문에 대해 검열을 피할 수 있는 대체 답변을 생성하도록 유도하여 자사 모델이 관련 대화를 회피하도록 훈련시키려는 시도도 포착되었으며, 앤스로픽은 요청 메타데이터를 분석하여 해당 연구소의 특정 연구원들까지 추적해냈습니다.
두 번째로 문샷 에이아이는 340만 회 이상의 상호작용을 발생시켰으며, 에이전트 기반 추론, 도구 사용 능력, 복잡한 코딩, 데이터 분석 및 컴퓨터 비전 기능 등 광범위한 영역을 노렸습니다. 이들은 다양한 종류의 계정을 섞어 사용하여 조직적인 공격임을 철저히 숨기려 했으나, 앤스로픽은 고위 직원의 공개 프로필과 일치하는 메타데이터를 통해 이들의 캠페인을 성공적으로 식별해냈습니다. 나중에는 클로드의 추론 과정을 역추적하고 재구성하려는 더욱 치밀한 접근 방식까지 사용한 것으로 드러났습니다.
세 번째로 미니맥스는 1천 3백만 회 이상의 압도적인 상호작용을 통해 에이전트 코딩 및 도구 조율 기능 등을 집요하게 추출하려 시도했습니다. 이 캠페인은 그들이 훈련 중인 모델을 정식으로 출시하기도 전인 활성화 단계에서 앤스로픽에 의해 적발되었습니다. 특히 앤스로픽이 미니맥스의 공격 도중 새로운 최신 모델을 깜짝 출시하자, 이들은 불과 24시간 만에 자사 트래픽의 절반 가까이를 새로운 모델 쪽으로 급격히 리디렉션하여 최첨단 시스템의 기능을 즉각적으로 탈취하려 하는 기민함과 대담함을 보였습니다.
## 공격자들의 우회 접속 방식 및 증류 공격의 기술적 특징
현재 앤스로픽은 국가 안보상의 이유로 중국 내에 위치하거나 중국 외부에 있는 해당 국가 소속 자회사에게는 클로드 상업용 접근 권한을 일절 제공하지 않고 있습니다. 공격자들은 이러한 엄격한 지역 접근 제한을 우회하기 위해 상업용 프록시 서비스를 이용해 접근 권한을 재판매 받는 방식을 채택했습니다. 이른바 히드라 클러스터라고 불리는 이 거대한 네트워크는 수많은 사기 계정을 타사 클라우드 플랫폼과 응용 프로그램 인터페이스 전체에 분산시키며, 한 계정이 차단되면 즉각적으로 새로운 계정이 그 자리를 대체하도록 설계되어 단일 장애점이 존재하지 않습니다. 심지어 단일 프록시 네트워크가 2만 개 이상의 사기 계정을 동시에 관리하면서 정상적인 고객의 일반 요청과 증류 트래픽을 교묘하게 뒤섞어 탐지를 극도로 어렵게 만들기도 했습니다.
일단 시스템 접근 권한이 확보되면, 이들은 특정 기능을 추출하기 위해 극도로 세밀하게 조작된 프롬프트를 대량으로 쏟아냅니다. 예를 들어 데이터 분석가 역할을 부여하며 요약이나 시각화가 아닌 철저한 데이터 기반의 심층적이고 투명한 추론을 요구하는 방식의 프롬프트를 사용합니다. 이러한 개별 요청 자체는 일반적인 사용과 크게 다를 바 없어 보일 수 있지만, 동일하게 좁은 범위의 기능을 표적으로 삼는 유사한 형태의 프롬프트가 수백 개의 조직화된 계정을 통해 수만 번씩 반복적으로 쏟아지는 패턴을 보일 때 비로소 증류 공격의 명백한 징후가 드러나게 됩니다.
## 앤스로픽의 적극적인 대응 방안 및 산업계의 협력 촉구
이러한 고도화된 위협에 맞서 앤스로픽은 불법적인 모델 증류 공격의 실행을 어렵게 만들고 더욱 빠르고 정확하게 식별해낼 수 있는 다각적인 방어 체계에 대한 투자를 아끼지 않고 있습니다. 우선 트래픽 내에서 증류 공격의 패턴을 식별해내는 여러 가지 분류기와 행동 지문 시스템을 자체적으로 구축하여 대규모 계정의 조율된 비정상 활동을 실시간으로 감지하고 있습니다. 또한 다른 인공지능 연구소, 클라우드 제공업체 및 관련 규제 당국과 기술적 공격 지표를 긴밀하게 공유하여 증류 공격 환경에 대한 종합적이고 거시적인 시야를 확보하고 있습니다. 이에 더해 사기 계정 생성에 자주 악용되는 교육용 계정, 보안 연구 프로그램, 스타트업 단체 등의 유입 경로에 대한 신원 검증 절차를 대폭 강화했습니다. 나아가 정상적인 고객의 사용 경험은 전혀 훼손하지 않으면서도 모델의 결과물이 불법적인 증류에 사용될 때의 효율성을 크게 떨어뜨릴 수 있도록 제품 및 모델 단위의 심층적인 안전장치를 지속적으로 개발 및 적용해나가고 있습니다.
이러한 산업 규모의 불법 증류 공격은 단일 기업의 자체적인 노력이나 기술력만으로는 결코 완벽하게 근절할 수 없습니다. 이는 전체 인공지능 산업계, 클라우드 인프라 제공업체, 그리고 전 세계의 정책 입안자들이 모두 합심하여 신속하고 조직적인 공동 대응에 나서야만 근본적으로 해결할 수 있는 중대한 과제입니다.

