FireTofu
為了訓練大型語言模型,包括 OpenAI、Anthropic、亞馬遜在內的科技公司,正大量購入2022年前出版的實體圖書。部分書籍在倉庫中被拆掉書脊、以破壞性的方式集中掃描,以獲取未受 AI 污染的「前 ChatGPT 時代」文字資料。

社会 · zh

為了訓練大型語言模型,包括 OpenAI、Anthropic、亞馬遜在內的科技公司,正大量購入2022年前出版的實體圖書。部分書籍在倉庫中被拆掉書脊、以破壞性的方式集中掃描,以獲取未受 AI 污染的「前 ChatGPT 時代」文字資料。

端传媒 · 2026年8月27日 23:05 UTC

長期以來,Anthropic、Meta 等公司習慣繞過作者和版權方,從互聯網大量下載盜版書籍,用於訓練 AI。2024年,三名美國作家對 Anthropic 提起版權訴訟。今年8月,Anthropic 同意為此案支付15億美元的和解金。 此案的法庭文件,也揭露了Anthropic 自2024年起啟動名為「巴拿馬項目」(Project Panama)的計畫,批量購入數百萬本實體書,再逐本掃描、數位化,便丟棄紙質原件。 《華盛頓郵報》報導,Anthropic 內部稱巴拿馬項目為「破壞性掃描全球所有書籍的計畫」,文件還寫道:「我們不希望外界知道我們正在進行這項工作。」法庭文件中一份提供給供應商的提案顯示,其計畫在六個月內破壞並掃描50萬至200萬本書。 AI 公司對高品質訓練資料的渴求更催生出為 AI 公司採購實體書的生意⋯⋯ 👉 點擊連結,閱讀全文:

科学 · 虎嗅

大模型越烧钱,AI 研究为什么反而迎来“小机构窗口”?

今年8月,独立AI评测机构METR说,过去半年里,它获得了约7100万美元的资金承诺。 METR不训练基础模型,没有数据中心,也没有一款等待冲上应用榜的聊天产品。它做的是另一件听起来不那么热闹的事:让模型做一批尽量接近真实工作的任务,记录它用了哪些工具、在哪一步卡住、能连续完成多长时间的工作,再把方法和结果放出来。…
阅读原文 ↗
科技 · 虎嗅

“AI味”不是在一句话里,而是渗透了所有的文字

相信很多人现在见到“不是……而是”,已经会下意识 PTSD 了:这是不是 AI 写的?还有各种破折号,冒号,以及经典版本“稳稳地接住你”“我用最直白的话,不绕弯子地告诉你”…… 当然,这些不断被总结出来的“AI 用语”也在不断失效,可能是模型升级一次,或者让另一个模型改写一遍,常见词汇、句式和标点都可以被洗掉。…
阅读原文 ↗