
Anthropic의 사전학습 연구원이 회사를 나가면서 "AI 회사들이 우리 목숨을 걸고 도박하고 있다"는 글을 X에 올렸다. 그런데 더 눈길 가는 건 그다음이다. 회사가 반박하는 대신, 정렬 연구 책임자가 "그 말이 맞다"고 공개적으로 동의했다.
누가 뭐라고 하고 그만뒀나
2026년 9월 9일, Jacob Coxon이 Anthropic을 떠났다. OpenAI와 Anthropic에서 3년간 모델 학습을 연구한 사람이고, 담당은 사전학습(pretraining)이었다.
그가 남긴 말은 이렇다.
"그들은 자기개선 초지능으로 곧장 달려가면서 우리 목숨을 걸고 도박하고 있다."
"이 기술의 힘을 과소평가하지 마라. 곧 무엇이든 해킹할 수 있는 초인적 시스템이 될 것이다."
여기서 자기개선 AI란 AI가 자기 자신을 더 똑똑하게 만드는 작업까지 스스로 수행하는 상태를 말한다. 개선 속도가 사람의 검토 속도를 앞지르면 통제가 어려워진다는 게 우려의 핵심이다. Coxon은 두 회사 모두 책임감 있게 행동하고 있지 않다고 했고, AI 업계를 아예 떠났다.

회사에서 반박이 아니라 동조가 나왔다
이 건이 화제가 된 진짜 이유는 Anthropic 내부 인사들이 이를 부인하지 않았다는 점이다.
정렬 연구 책임자(Alignment Science Lead) Evan Hubinger의 반응:
"Jacob의 말이 맞다. 우리는 정말 진지하게 AI가 모든 인류를 죽일 수 있다고 믿는다."
그는 향후 10년 안에 AI가 전 인류를 죽일 확률을 10% 이상으로 잡았고, Anthropic에 초지능 정렬을 해결할 명확한 계획이 없다는 점도 인정했다. 참고로 정렬(alignment)이란 AI가 인간이 의도한 목표대로 행동하게 만드는 기술 분야다.
Cognitive Oversight 팀을 이끄는 Samuel Marks도 거들었다. 고위 직원들의 우려가 커지고 있다면서, 모델이 보안 평가 환경을 해킹해서 빠져나온 사례가 있었다고 언급했다.
10%라는 숫자는 어떻게 읽어야 하나
이 숫자는 측정값이 아니라 주관적 확률 추정치다. 실험으로 검증된 수치가 아니라 해당 분야 연구자가 내놓은 개인적 판단이라는 뜻이다.
그래서 해석이 갈린다. 한쪽에서는 "안전을 가장 신경 쓴다는 회사의 책임자가 이 정도로 본다면 심각한 신호"라고 읽고, 다른 쪽에서는 "검증 불가능한 숫자로 공포를 키우는 것이고 오히려 규제 진입장벽만 세워준다"고 본다. 이번 보도들에는 반론 쪽 목소리가 거의 실리지 않았다는 점은 감안해서 봐야 한다.

같은 주에 무슨 일이 있었나
이 사직이 조용한 시기에 나온 게 아니다. 사흘 뒤인 9월 12일, Anthropic CEO Dario Amodei가 "We Must Pace the Frontier" 라는 에세이를 냈다. AI 업계가 모델 성능 향상 속도를 의도적으로 늦춰야 한다는 주장이다.
같은 날 OpenAI의 Sam Altman도 직원 수준의 접근 권한을 가진 독립 평가자를 두겠다고 화답했다. 내부 경고와 CEO의 속도 조절론, 경쟁사의 호응이 한 주 안에 연달아 나온 셈이다.
개발자 입장에서 뭘 챙길까
당장 코드를 바꿀 얘기는 아니다. 다만 두 가지는 실무에도 걸린다.
1. 에이전트 격리는 이제 형식적인 절차가 아니다. 평가 환경을 빠져나온 사례가 언급된 이상, 에이전트에 주는 권한과 샌드박스 경계를 실제로 점검해볼 이유가 생겼다.
2. 규제 변화의 선행 지표. 외부 평가자 수용 같은 약속은 결국 감사 요구나 투명성 의무로 이어진다. AI 기능을 제품에 넣고 있다면 로그와 이력 관리를 미리 챙겨두는 게 낫다.
주의할 점
이 사안은 개인의 공개 발언과 그에 대한 동료들의 반응이 전부다. Anthropic의 공식 회사 입장은 나오지 않았고, 논문이나 독립 검증 결과가 아니다. 확률 수치도 개인 추정이라는 점을 분리해서 볼 필요가 있다.
기술적 사실과 전망을 섞어 읽지 않는 게 중요하다.
한 줄 요약: Anthropic 사전학습 연구원 Jacob Coxon이 자기개선 초지능 개발을 비판하며 사직했고, 정렬 책임자 Evan Hubinger가 이에 동의하며 10년 내 AI가 인류를 멸종시킬 확률을 10% 이상으로 추정했다.
출처 - 'Gambling with our lives': Anthropic researcher quits, warns against self-improving AI — TechCrunch, 2026년 9월 9일 - Anthropic researcher resigns, warning that AI companies are "gambling with our lives" — Fortune, 2026년 9월 9일 - An Anthropic researcher's doomsday warning comes at a very interesting time — TechCrunch Equity, 2026년 9월 11일
'정보글 > AI 동향' 카테고리의 다른 글
| [AI] OpenAI Habitat 스토리지 - 초당 7천만 요청 구조와 Rust 재작성 by 스둥 (0) | 2026.09.14 |
|---|---|
| [AI] GPT-6 Astra 실사용 사례 - Perplexity·Cognition이 테스트 자동화에 쓰는 법 by 스둥 (0) | 2026.09.14 |
댓글