모델 추출 vs. 모델 역추론: 이미 당신의 AI 스택을 노리고 있는 공격

핵심 요약

모델 추출은 모델에 반복적으로 질의하고 그 결과를 학습해 복제 모델을 만드는 방식으로, 원본 모델의 역량을 탈취합니다. 모델의 가중치나 학습 데이터에 직접 접근할 필요는 없습니다. 반면 모델 역추론은 모델의 출력을 역으로 분석해 학습에 사용된 데이터를 탈취합니다.

첫 번째는 지식재산권 침해이고, 두 번째는 개인정보 침해입니다. 두 공격 모두 API 접근 권한만으로 실행할 수 있습니다. 2026년 알리바바와 Anthropic 간의 사례는 현재까지 기록된 모델 추출 사례 중 가장 큰 규모입니다.

알리바바와 Anthropic 사례가 보여준 것

  • 알리바바의 Qwen 연구소는 2026년 4월 22일부터 6월 5일까지 약 2만 5,000개의 부정 계정을 이용해 Claude와 2,880만 회에 달하는 상호작용을 수행했습니다. (Anthropic이 미국 상원 은행위원회에 보낸 서한, 2026년 6월 10일)
  • Anthropic은 이를 현재까지 알려진 최대 규모의 증류 공격이라고 설명했습니다. 이는 앞서 DeepSeek, Moonshot AI, MiniMax 등 중국 AI 연구소 3곳이 약 2만 4,000개의 계정으로 수행한 1,600만 건의 상호작용을 모두 합친 것보다도 큰 규모입니다.
  • 이 캠페인은 Claude의 에이전트형 추론과 소프트웨어 엔지니어링 역량을 집중적으로 겨냥했습니다. Anthropic이 엔터프라이즈 제품의 핵심으로 내세워 온 최첨단 역량들입니다.
  • 공격은 4월 22일에 시작됐습니다. 이는 미국 백악관 과학기술정책실의 마이클 크라치오스 국장이 바로 이러한 위협을 경고한 4월 24일자 메모가 발표되기 이틀 전입니다. 이후에도 공격은 6주간 공개적으로 계속됐습니다. Anthropic은 서한에서 이 시점을 명확하게 언급했습니다.
  • Anthropic은 적대적 증류를 통해 만들어진 모델에는 안전 보호 장치가 부족한 경우가 많으며, 이로 인해 지식재산권 침해를 넘어선 후속 위험이 발생할 수 있다고 경고했습니다.
  • 이 서한은 AI 관련 상원 은행위원회 청문회를 앞두고 팀 스콧 상원의원과 엘리자베스 워런 상원의원에게 전달됐습니다. 향후 규제가 어떤 방향으로 나아갈지를 보여주는 신호입니다.
  • 다만 이는 전반적으로 Anthropic 측의 주장입니다. 6월 말 기준 알리바바는 공개적으로 답변하지 않았으며, 공개 API를 통한 증류가 지식재산권 침해에 해당하는지는 여전히 법적으로 명확하게 정리되지 않은 문제입니다.

모델 추출이란?

모델 추출은 모델 탈취 또는 증류 공격이라고도 하며, 다음과 같은 방식으로 작동합니다. 공격자는 API를 통해 대상 모델에 정교하게 설계된 대량의 입력을 전송하고, 입력과 출력의 쌍을 수집합니다. 그런 다음 이 데이터를 사용해 대상 모델의 동작을 근사하는 별도의 모델을 학습합니다. 가중치에 접근할 필요도 없습니다. 학습 데이터에 접근할 필요도 없습니다. API만 있으면 됩니다.

이 공격이 가능한 이유는 모델의 출력에 모델의 역량이 담겨 있기 때문입니다. 충분히 크고 다양한 질의 집합을 확보하면 모델의 의사결정 경계를 충분히 드러낼 수 있고, 이를 학습한 대체 모델은 공격자가 중요하게 여기는 작업에서 원본 모델의 성능을 상당 부분 재현할 수 있습니다.

알리바바의 사례는 공개 기록상 이를 보여주는 가장 명확한 대규모 사례입니다. Qwen 연구소는 Anthropic의 인프라를 침해하지 않았습니다. 대신 2만 5,000개의 계정을 만들고 수천만 건의 상호작용을 생성한 뒤 그 출력으로 학습했습니다. 이 기법은 지식 증류라고 하며 머신러닝 연구에서는 표준적인 방식입니다. 하지만 경쟁사의 상용 모델에 허가 없이 적용할 경우 서비스 이용약관 위반이자 잠재적인 지식재산권 침해가 됩니다.

경제적 구조를 보면 그 유인이 분명합니다. 최첨단 모델을 처음부터 학습하려면 수억 달러와 수년의 개발 기간이 필요합니다. 반면 모델 추출에는 API 사용 비용과 대체 모델을 학습하기 위한 컴퓨팅 시간만 필요합니다. 역량 격차를 빠르게 좁히려는 연구소라면 계산은 명확합니다.

모델 역추론이란?

모델 역추론은 목표 자체가 완전히 다른 공격입니다. 모델 추출이 모델이 무엇을 하는지를 복제하려는 공격이라면, 모델 역추론은 모델이 무엇으로 학습됐는지를 복구하려는 공격입니다.

이 공격은 일반적으로 신뢰도 점수나 확률 분포와 같은 모델의 출력을 분석해 학습 데이터와 유사한 사례를 역으로 재구성하는 방식으로 작동합니다. 얼굴 인식 모델에서는 학습 데이터에 얼굴이 포함된 개인의 이미지를 복원하는 데 사용된 사례가 있습니다. 의료 머신러닝 모델에서는 비슷한 기법을 통해 환자 기록을 복구한 사례가 있습니다. 언어 모델에서는 사전 학습 데이터에 포함된 독점 정보나 민감한 텍스트가 노출될 수 있습니다.

모델 역추론은 모델 추출보다 실행하기 어렵고 더 높은 수준의 기술적 전문성이 필요하기 때문에 상대적으로 덜 다뤄집니다. 하지만 법률 및 규정 준수 관점에서는 두 공격 중 더 위험하다고 볼 수도 있습니다. 의료 기록, 금융 정보 또는 사용자 생성 콘텐츠로 학습된 모델에 대한 역추론 공격이 성공하면 모델 소유자뿐 아니라 데이터가 사용된 사람들에게 직접적인 피해가 발생하기 때문입니다.

엔지니어링 리더에게는 양방향 모두가 중요합니다. API로 사용하는 모델에서 무엇이 추출될 수 있는지, 그리고 직접 구축해 외부에 공개한 모델에서 어떤 학습 데이터가 노출될 수 있는지를 모두 고려해야 합니다.

한눈에 보는 주요 차이점

No. Dimension Model Extraction Model Inversion
1 Goal Steal model capability Recover training data
2 Method Query API, train surrogate on outputs Probe outputs to reverse-engineer inputs
3 What the attacker needs API access + compute API access + ML expertise
4 Primary victim Model owner (IP and competitive advantage) Data subjects (privacy)
5 What's stolen Functionality, reasoning, specialization Personal data, proprietary content
6 Legal exposure ToS violation, trade secret law, IP law GDPR, HIPAA, CCPA, data protection law
7 Detection difficulty Moderate (anomalous query volume/patterns) Hard (probing can be subtle)
8 Real-world examples Alibaba → Claude (2026); DeepSeek, Moonshot AI, MiniMax → Claude (2026) Facial recognition models; clinical ML models
9 Defenses Rate limiting, query monitoring, output watermarking Differential privacy, output truncation, membership inference testing

두 공격 모두 API 접근 권한만 있으면 가능합니다. 공격자가 모델의 가중치나 학습 데이터에 직접 접근할 필요는 없습니다.

엔지니어링 리더가 나중이 아니라 지금 관심을 가져야 하는 이유

공격 표면은 최첨단 AI 연구소만이 아니라 여러분이 공개한 모든 모델 API입니다.

Anthropic과 OpenAI는 이러한 캠페인을 탐지하고 공개할 수 있는 리소스와 가시성을 갖추고 있습니다. 하지만 LLM을 기반으로 또는 LLM과 함께 제품을 구축하는 대부분의 기업은 그렇지 않습니다. 독점 데이터로 모델을 파인튜닝한 뒤 내부 또는 외부 API를 통해 공개했다면 해당 모델은 추출될 수 있습니다. 민감한 데이터로 모델을 학습했고 모델이 확률 분포를 반환한다면 모델 역추론 공격 역시 고려 대상입니다.

적대적 증류로 만들어진 모델에는 안전 보호 장치가 빠져 있는 경우가 많습니다.

Anthropic은 상원에 보낸 서한에서 이 점을 명확하게 언급했으며, 이는 지식재산권 관점을 넘어 진지하게 받아들일 가치가 있습니다. Claude에서 추출한 모델은 Claude의 인간 피드백 기반 강화학습, Constitutional AI 학습 또는 안전성 평가 인프라까지 물려받지 않습니다. 물려받는 것은 역량이지 정렬이 아닙니다. 후속 위험은 Anthropic에만 국한되지 않습니다. 생태계의 다른 곳에 배포된 안전장치가 제거된 Claude 대체 모델과 상호작용하게 되는 모든 사람이 영향을 받을 수 있습니다.

규제는 이러한 사건에 앞서 움직이는 것이 아니라, 사건에 대응해 움직이고 있습니다.

알리바바 관련 서한이 상원 은행위원회에 전달된 것은 단순한 언론 대응이 아닙니다. 예정된 청문회를 앞두고 정책 결정자에게 보내는 의도적인 신호입니다. 모델 추출과 모델 역추론의 차이를 이해하는 엔지니어링 리더는 향후 규정 준수 요건이 도입됐을 때 뒤늦게 통제 장치를 추가하느라 서두르기보다 더 잘 대비할 수 있습니다. 해거티 상원의원과 김 상원의원은 적대적 증류를 수행하는 기관을 블랙리스트에 올리거나 제재하기 위한 국방 법안 수정안을 추진하고 있으며, 하원에서도 관련 법안이 논의되고 있습니다.

실제로 취할 수 있는 대응 조치

완벽한 해결책은 없으며, 대부분의 방어 수단도 아직 발전 중입니다. 하지만 지금부터 취할 수 있는 구체적인 조치는 있습니다.

모델 추출 방어:

  • API 계층에서 쿼리 패턴을 모니터링하세요. 2만 5,000개의 계정을 통한 2,880만 건의 호출은 모니터링하고 있다면 탐지할 수 있습니다. 비정상적인 쿼리 분포, 신규 계정의 높은 요청량, 모델 역량 영역을 체계적으로 탐색하는 패턴은 모두 신호가 될 수 있습니다. 대부분의 팀은 이를 살펴보고 있지 않습니다.
  • 신규 계정에는 강력한 사용량 제한을 적용하세요. 알리바바의 사례에는 대규모 부정 계정 생성이 필요했습니다. 신규 또는 미인증 계정의 사용량을 제한하는 행동 기반 정책은 모델 추출에 노출되는 범위를 크게 줄입니다.
  • 출력 워터마킹을 검토하세요. 모델 출력에 암호학적 또는 통계적 워터마크를 삽입하는 기술은 현재 활발히 연구되고 있습니다. 이를 통해 모델 소유자는 자신의 출력이 경쟁 모델의 학습에 사용됐는지 탐지할 수 있습니다. 아직 모든 환경에서 프로덕션에 적용할 수준은 아니지만, 지켜볼 가치가 있습니다.

모델 역추론 방어:

  • 학습 데이터에 무엇이 포함됐는지 감사하세요. 모델 역추론 위험은 학습 데이터의 민감도와 모델 출력이 담고 있는 정보량에 비례합니다. 규제 대상 데이터인 개인 식별 정보, 개인 건강 정보, 금융 기록이 학습 데이터에 포함돼 있다면 모델 역추론 위험을 위협 모델에 포함해야 합니다.
  • 가능하다면 출력 분포를 제한하세요. 전체 확률 분포 대신 가장 높은 예측 결과만 반환하면 모델 역추론 공격의 난도가 크게 높아집니다.
  • 모델을 공개하기 전에 멤버십 추론 테스트를 실행하세요. 멤버십 추론은 특정 데이터가 모델의 학습 데이터에 포함됐는지를 알아내는 관련 기법입니다. 모델이 멤버십 추론에 취약하다면 모델 역추론에도 취약할 가능성이 더 높습니다.

두 공격 모두에 대한 방어:

  • 서드파티 API를 기반으로 제품을 구축한다면 계약상 위험을 검토하세요. 독점 데이터를 서드파티 모델에 입력하고 있다면 해당 제공업체의 이용약관에서 데이터 사용, 학습 및 보관에 대해 어떻게 규정하고 있는지 확인해야 합니다.

마무리

알리바바와 Anthropic의 사례는 이례적인 사건이 아닙니다. Anthropic이 2026년 초 DeepSeek, Moonshot AI, MiniMax의 유사한 캠페인을 처음 공개한 이후 계속 가속화돼 온 패턴 중 가장 큰 사례입니다. AI 역량이 소수의 최첨단 모델에 집중될수록 처음부터 구축하기보다 기존 모델을 추출하려는 유인은 더 커질 것입니다.

모델 추출과 모델 역추론은 서로 다른 방어 전략과 법적 위험을 가진 별개의 위협입니다. 두 공격의 차이를 이해하는 엔지니어링 리더는 공급업체에 더 정확한 질문을 하고, 더 방어력 있는 시스템을 구축하며, 규제 기관이 질문을 시작할 때 더 잘 대비할 수 있습니다.

자주 묻는 질문

모델 추출과 모델 역추론의 차이는 무엇인가요?

모델 추출은 API 출력으로 대체 모델을 학습해 원본 모델이 수행하는 기능을 복제합니다. 모델 역추론은 모델의 출력을 역으로 분석해 모델이 무엇으로 학습됐는지를 복구합니다. 모델 추출은 모델 소유자의 지식재산권과 경쟁력을 위협합니다. 모델 역추론은 학습 데이터에 정보가 포함된 개인이나 조직의 개인정보를 위협합니다.

모델 추출은 불법인가요?

알리바바와 Anthropic의 사례에서 사용된 방식의 모델 추출은 서비스 이용약관을 위반하며, 적용되는 법률에 따라 영업비밀 침해나 지식재산권 침해에 해당할 수 있습니다. 다만 법적 해석은 아직 발전 중입니다. Anthropic이 미국 상원 은행위원회에 해당 내용을 공개한 것은 정책적 대응과 잠재적인 법적 조치를 모두 추진하고 있음을 시사합니다. 지식 증류 자체는 자신이 소유하거나 해당 목적으로 사용할 수 있도록 라이선스를 받은 모델에 적용할 경우 불법이 아닙니다.

알리바바 어떻게 Claude를 추출했나요?

Anthropic이 2026년 6월 10일 미국 상원의원들에게 보낸 서한에 따르면, 알리바바의 Qwen 연구소와 연계된 운영자들은 약 2만 5,000개의 부정 계정을 만들고 2026년 4월 22일부터 6월 5일까지 Claude와 2,880만 회 이상의 상호작용을 생성했습니다. 이 상호작용은 Claude의 가장 발전된 에이전트형 추론 및 소프트웨어 엔지니어링 역량에 집중됐습니다. 이 상호작용에서 얻은 출력은 알리바바의 자체 모델을 학습하거나 파인튜닝하는 데 사용됐습니다. 이 과정을 지식 증류라고 합니다.

증류 공격이란 무엇인가요?

증류 공격은 더 크고 역량이 뛰어난 교사 모델의 출력을 사용해 더 작은 학생 모델을 학습하는 모델 추출 공격의 한 형태입니다. 이를 통해 전체 개발 비용의 일부만으로 모델의 역량을 이전할 수 있습니다. 정상적인 머신러닝 연구에서 지식 증류는 모델 소유자가 자신의 모델을 압축할 때 사용하는 표준적인 기법입니다. 하지만 경쟁사의 모델에 허가 없이 적용하면 지식재산권 침해 수단이 됩니다.

우리 회사의 모델도 추출될 수 있나요?

모델을 API를 통해 공개하고 해당 출력에 의미 있는 역량 정보가 포함돼 있다면 원칙적으로 가능합니다. 실질적인 추출 위험은 모델에 얼마나 많은 역량이 담겨 있는지, API 접근이 얼마나 쉬운지, 모델 추출 패턴을 얼마나 면밀하게 모니터링하는지에 따라 달라집니다. 내부 API를 통해 공개된 파인튜닝 모델은 최첨단 상용 모델보다 덜 주목받는 대상이지만, 공격에서 완전히 자유로운 것은 아닙니다.

모델 추출을 막는 가장 효과적인 방법은 무엇인가요?

하나의 방어 수단만으로는 충분하지 않습니다. 가장 현실적인 조합은 신규 또는 미인증 계정에 대한 강력한 사용량 제한, 모델 추출 패턴을 탐지하기 위한 API 질의 모니터링, 가능한 경우 출력 워터마킹을 함께 사용하는 것입니다. 장기적으로는 모델 출력에 적용하는 암호학적 워터마킹이 탐지와 법적 귀속을 모두 지원할 수 있는 가장 유망한 방식입니다.

진행 중인 모델 추출 공격은 어떻게 탐지하나요?

모델 추출 공격은 질의 패턴의 이상 징후를 통해 탐지할 수 있습니다. 신규 또는 미인증 계정에서 발생하는 비정상적으로 높은 요청량, 실제 작업을 위한 자연스러운 질의가 아니라 모델의 역량 영역을 체계적으로 탐색하는 패턴, 자동 생성과 일치하는 낮은 질의 구조 변화 등이 대표적인 신호입니다. 알리바바 사례에서는 약 2만 5,000개의 부정 계정에서 발생한 2,880만 건의 호출에서 이 세 가지 신호가 동시에 나타났습니다. 사용량 제한만으로는 충분하지 않습니다. 조직적인 캠페인은 계정별 제한을 피하기 위해 요청을 여러 계정에 분산하기 때문입니다. 효과적인 탐지를 위해서는 사용량 제한 위에 행동 기반 모니터링을 추가해야 합니다. 질의 패턴이 실제 작업 중심이 아니라 자동화된 요청처럼 보이는 계정을 식별하고, 모델이 수행할 수 있는 전체 역량을 순서대로 탐색하는 행위를 신뢰도 높은 모델 추출 신호로 간주해야 합니다. 인시던트 대응 프로세스가 있다면 확인된 모델 추출 시도는 나중에 처리할 정책 위반이 아니라 현재 진행 중인 보안 인시던트로 다뤄야 합니다.

모델 추출 공격이 의심될 때 엔지니어링팀은 어떻게 대응해야 하나요?

모델 추출 공격이 의심된다면 현재 진행 중인 보안 인시던트로 취급해야 합니다. 의심 계정을 정지하거나 격리하고, 모든 질의 로그를 즉시 보존하며, 법률 자문을 받아야 합니다. 영업비밀 침해 및 서비스 이용약관 위반 주장에 필요한 증거를 확보할 수 있는 기간이 짧기 때문입니다. 로그를 확보한 뒤에는 인시던트 이후의 질의 분석을 수행해 추출 수준을 평가해야 합니다. 어떤 역량 영역이 탐색됐는지, 어느 정도의 요청량이 처리됐는지, 대체 모델이 원본 모델과 실질적으로 활용 가능한 수준까지 유사한 성능을 낼 가능성이 있는지를 분석해야 합니다. 이후 신규 계정에 대한 사용량 제한 강화, 출력 정보 제한, 모니터링 강화 등을 통해 접근 경로를 차단하고, 위험에 노출된 모델 지식재산권의 상업적 가치에 따라 출력 워터마킹이 필요한지 판단해야 합니다. Anthropic과 알리바바의 사례는 규제 기관, 위원회 또는 대중에게 사건을 공개하는 것도 전략적 대응이 될 수 있음을 보여줍니다. 특히 해당 공격이 즉각적인 지식재산권 손실을 넘어 정책적 영향을 미치는 경우에는 더욱 그렇습니다.

온콜의 새로운 기준.
알림부터 해결까지 에이전트가 알아서.

“My favorite subscription by far. Fresh supply of templates and ready-to-use sections that save us hours on every project. Absolute no-brainer.”
Jeremy Olley
Small Agency
best deal
Save with BYQ Supply Ultra
BYQ Supply Ultra is our premium subscription that gives you access to our templates and 1800+ copy/paste sections library for half the price.
Webflow Marketplace
1 template for $129
With byq ultra
3 templates for $46 each + 1800 sections
3 template credits every quarter
Full access to 1800+ copy paste sections library
All new templates added during your subscription
With code CRAFTED20 only $46/month for the first quarter.
Cancel anytime.
Get Nerdstack with ULTRA