
社会 · zh
為了訓練大型語言模型,包括 OpenAI、Anthropic、亞馬遜在內的科技公司,正大量購入2022年前出版的實體圖書。部分書籍在倉庫中被拆掉書脊、以破壞性的方式集中掃描,以獲取未受 AI 污染的「前 ChatGPT 時代」文字資料。
長期以來,Anthropic、Meta 等公司習慣繞過作者和版權方,從互聯網大量下載盜版書籍,用於訓練 AI。2024年,三名美國作家對 Anthropic 提起版權訴訟。今年8月,Anthropic 同意為此案支付15億美元的和解金。 此案的法庭文件,也揭露了Anthropic 自2024年起啟動名為「巴拿馬項目」(Project Panama)的計畫,批量購入數百萬本實體書,再逐本掃描、數位化,便丟棄紙質原件。 《華盛頓郵報》報導,Anthropic 內部稱巴拿馬項目為「破壞性掃描全球所有書籍的計畫」,文件還寫道:「我們不希望外界知道我們正在進行這項工作。」法庭文件中一份提供給供應商的提案顯示,其計畫在六個月內破壞並掃描50萬至200萬本書。 AI 公司對高品質訓練資料的渴求更催生出為 AI 公司採購實體書的生意⋯⋯ 👉 點擊連結,閱讀全文:





