LLM 교육의 어두운 면: 앤트로픽의 '파나마 프로젝트'가 수백만 권의 책을 파괴했다는 의혹
앤트로픽의 '파나마 프로젝트'의 충격적인 실상을 알아보세요. 이 프로젝트는 수백만 권의 실물 책을 파괴적으로 스캔하여 인공지능 클로드(Claude)를 훈련시키려는 시도로 알려져 있습니다.

기계 학습을 위한 문학 학살
인공지능 패권을 향한 끊임없는 추구 속에서 고품질 학습 데이터에 대한 갈망은 극에 달했습니다. 대부분의 사용자는 깔끔한 인터페이스와 유용한 응답을 통해 AI와 상호 작용하지만, 그 이면에는 불안한 추세가 나타나고 있습니다. 클로드 시리즈를 개발한 AI 강자 앤트로픽(Anthropic)이 대규모 언어 모델(LLM) 학습 속도를 높이기 위해 수백만 권의 실물 도서를 수집하고 체계적으로 해체하는 대규모 작전을 벌였다는 보고가 나왔습니다.
"파나마 프로젝트"라는 코드명으로 알려진 이 작전은 인류 문화 보존과 AI 시대를 위한 데이터 수집의 산업화 사이의 갈등이 심화되고 있음을 보여줍니다.
'파나마 프로젝트'의 실체: 파괴의 메커니즘
워싱턴 포스트의 상세한 조사 등 여러 보고서에 따르면, 파나마 프로젝트는 단순한 디지털화 작업이 아니라 파괴적인 행위였습니다. 이 과정은 최대 효율성과 속도를 위해 설계되었으며, 보존보다는 처리량을 우선시했습니다.
보도에 따르면 이 워크플로는 다음과 같은 몇 가지 무자비한 단계를 포함했습니다.
- 대량 구매: 상업 시장에서 방대한 양의 인쇄물을 구매하기 위해 수백만 달러를 지출했습니다.
- 파괴적 준비: 제본된 책을 조심스럽게 스캔하는 대신, 회사는 책의 책등을 잘라냈다고 합니다. 이로써 개별 페이지를 고속 산업용 스캐너에 넣어 기존의 책 스캔 방식보다 훨씬 빠른 속도로 스캔할 수 있었습니다.
- 디지털화: 낱장들은 기계가 읽을 수 있는 텍스트로 변환되었고, 이 텍스트는 클로드의 인지 능력을 향상시키는 데 사용된 방대한 데이터 세트에 통합되었습니다.
- 폐기: 텍스트 추출 후, 제본이 제거된 나머지 물리적 조각들은 폐기물로 버려졌습니다.
내부 계획 문서에는 이 프로젝트가 섬뜩할 정도로 명확하게 묘사되어 있다고 합니다. "프로젝트 파나마는 전 세계 모든 책을 파괴적으로 스캔하려는 우리의 노력입니다."라고 적혀 있으며, "우리가 이 프로젝트를 진행하고 있다는 사실이 알려지는 것을 원하지 않습니다."라고 덧붙였습니다.
법적 파장과 '공정 사용' 논쟁
프로젝트 파나마를 둘러싼 논란은 인공지능 시대의 저작권을 둘러싼 광범위한 법적 분쟁과 밀접하게 관련되어 있습니다. 앤트로픽은 최근 15억 달러에 달하는 대규모 저작권 소송 합의금을 지불했습니다. 법원은 AI 모델 훈련이 일반적으로 "공정 사용"에 해당한다고 판결하면서, AI의 학습 과정을 인간 작가가 기존 작품을 연구하여 새로운 작품을 창작하는 것에 비유했습니다. 그러나 법원은 앤트로픽이 700만 권의 불법 복제 도서를 보유한 것은 저작권 침해라고 판단했습니다.
오픈AI, 구글, 메타와 같은 다른 AI 대기업들도 디지털 라이브러리 사용과 관련하여 유사한 소송에 직면했지만, 앤트로픽은 데이터 수집 목표를 달성하기 위해 실물 도서를 물리적으로 파괴한 것으로 알려진 유일한 주요 기업입니다.
앤트로픽의 답변
톰스 가이드의 질문에 대해 앤트로픽 대변인은 도서 수집 관행을 옹호하며, 이는 AI 업계 전반에서 흔히 사용되는 방식이라고 지적했습니다. 회사는 희귀본이나 고서를 대상으로 하지 않는다고 강조하며, "당사의 데이터 수집 프로그램은 '희귀본'이나 '고서'를 구매하여 파괴하지 않습니다. 우리는 일반 상업 시장에서 책을 구매합니다."라고 밝혔습니다. 법적 분쟁과 관련하여 회사는 바르츠 합의를 언급하며 법원이 저작권법에 따라 AI 학습의 합법성을 인정했다고 주장했습니다.
윤리적 결론
프로젝트 파나마의 폭로는 심각한 윤리적 문제를 제기합니다. 회사는 일반 상업 서적만을 대상으로 했다고 주장하지만, 디지털 사본을 위해 수백만 권의 실물 서적을 체계적으로 파괴한 것은 위태로운 선례를 남깁니다. 대량으로라도 실물 문헌이 손실되는 것은 인간 사상의 원본 산물이 언젠가 저자를 대체할 수 있는 알고리즘을 구동하기 위해 희생되는 세상으로의 전환을 의미합니다.
AI가 계속 발전함에 따라 데이터에 대한 필요성과 물리적 및 지적 재산권 존중 사이의 긴장은 기술 분야에서 가장 중요한 과제 중 하나로 남아 있습니다.