2026 text acquisition是這篇文章討論的核心

💡 核心結論:2026 年 AI 訓練數據正式進入「存量掠奪」時代。網路上的高品質文本已被 AI 生成物污染,大廠被迫回頭搶收未被污染的實體書,掃描後直接銷毀以獨佔數據,這不是陰謀論,而是法院文件裡白紙黑字寫下的商業策略。
📊 關鍵數據(2027 年以後量級):全球 AI 訓練數據市場 2026 年估值約 39 億美元,2033 年將衝上 163 億美元(CAGR 22.6%);Anthropic 以每本約 3,000 美元、總額 15 億美元的天價和解版權訴訟;單一案件涉及逾 48 萬部書籍作品。
🛠️ 行動指南:出版社與獨立書商應建立「AI 授權窗口」;創作者務必確認作品是否落入和解清單並登記權益;企業導入 AI 前須要求供應商揭露訓練資料來源與版權履歷。
⚠️ 風險預警:稀有絕版書可能被掃完即焚、永久消失;實體書二手市場價格被 AI 買家扭曲;後續恐引爆更多集體訴訟與各國資料來源揭露法規。
七月的舊金山,我盯著某二手書商倉庫的庫存清單,整排整排的「已售出」標記——買家不是收藏家,而是 AI 公司。這幾個月,從美東的庫存拍賣會到歐陸的絕版書展,實體書正以一種近乎荒謬的姿態回流:一卡車一卡車被運走,拆掉書封、切開書脊、高速掃描成影像檔,然後直接送進碎紙機。別急著罵暴殄天物,這背後藏著 2026 年 AI 產業最尖銳的集體焦慮——乾淨的數據,真的快被榨乾了。
早在今年初,法院陸續解封的文件就揭開了 Anthropic 代號「Project Panama」的計畫:大規模收購、掃描並銷毀數百萬本書籍,只為了餵養 Claude 系列模型。到了七月,這股風潮已經從檯面下蔓延成全行業的標準作業流程,連專門賣書目資料的 ISBNdb 都被踢爆曾公開向 AI 公司兜售實體書,隨後火速轉彎切割。今天這篇,我們不聊情懷,只拆解背後的商業邏輯、法律風險,以及 2027 年之後會怎麼演變。
為什麼 AI 公司要回頭搶購實體書?純淨文本稀缺背後的數學題
一句話:AI 吃膩了自己吐出來的東西。過去兩年,網路上流通的文章、貼文、評論,有極高比例已經是 AI 生成或 AI 改寫的二手貨。模型若拿這些「AI 生 AI」的文本繼續訓練,就會陷入所謂的模型崩潰(model collapse)——輸出越來越平庸、越來越像複讀機,最終失去原創性與事實準確度。於是,唯一還沒被污染的大型語料庫,只剩 2022 年之前印出來的實體書。
這是一道殘酷的供需數學:線上可用高品質文本的成長曲線早就撞上天花板,而模型參數量與訓練 token 需求卻還在指數暴衝。數據不夠,就只能去挖存量。一本 1980 年代的絕版小說、一份沒被數位化的學術專著,對模型來說就是「處女地」。掃完就銷毀,不是浪費,而是護城河——確保這批獨家數據不會流進競爭對手的訓練集。
🟦 Pro Tip:判斷一家 AI 公司的數據護城河,別只看算力訂單,要看它的「紙本書倉庫」。訓練資料的版權履歷(data provenance)未來會像食品成分表一樣被要求公開——誰能拿出乾淨的授權鏈,誰就能在合規審查中笑到最後。
掃完就燒合法嗎?從 15 億美元和解案看版權地雷
「買下書就是我的,想怎麼處理都行」——法律上,實體書的所有權確實如此(first-sale doctrine 首次銷售原則),但複製內容進模型訓練集,就是另一碼事了。2025 年 9 月,Anthropic 同意以 15 億美元和解 Bartz v. Anthropic 集體訴訟,賠償標準高達每部作品約 3,000 美元,最終批准聽證落在 2026 年 5 月,法官並在 7 月 20 日敲下最後一槌。這筆帳,等於替整個行業貼上了「未授權書籍訓練=高價罰單」的標價。
數據會說話:這樁和解涵蓋超過 48 萬部作品,索賠登記率高達 91.3%,幾乎所有符合資格的作者都跳出來主張權益。更耐人尋味的是,Meta 的 Kadrey 案至今仍在纏鬥——法院雖在 2025 年 6 月對「市場損害」理論給了 Meta 一記 summary judgment,但整體戰線並未落幕。換句話說,掃書、焚書的後座力,才剛開始發酵。
🟦 Pro Tip:創作者快去查官方「Works List」——只要作品在和解清單內,記得完成權益登記與申領程序。別以為小出版社沒人管,91.3% 的登記率證明,這筆錢是「有在做事的人」在領。
一本書從二手書店到訓練集的奇幻旅程
這條供應鏈已經產業化了。第一站是「獵書人」:專門掃貨的掮客批量掃蕩二手書店、倉庫清倉與絕版書展,鎖定 2022 年以前出版、未經數位化的紙本書;第二站是掃描廠:書脊被裁刀切開,高速自動翻頁掃描機把每一頁變成影像,再經 OCR 轉成文字;第三站是資料倉庫:文字被清洗、去重、標註後送進預訓練管線;最後一站是碎紙機——書本使命完成,物理銷毀,杜絕外流。
書商其實是最大贏家之一。經濟學人報導過,稀有與絕版書的詢價量暴增,AI 買家願意為「一本絕版書」付出遠超二手行情的價格,部分書商甚至開始公開標榜「供應 AI 訓練用書」。但這也讓獨立書商陷入道德兩難:賣書給 AI 等於贊助書籍滅絕,不賣又扛不住庫存壓力。而圖書館與檔案館更頭痛——它們手上的稀有館藏,正是 AI 公司最想要的獵物。
🟦 Pro Tip:獨立書商別只當「賣書的」,試著轉型成「版權仲介」:與出版社洽談掃描授權、抽取授權金,比一次性賣斷更長久,也更能守住文化資產的底線。
2027 年之後:合成數據、絕版書危機與產業終局
把時間軸拉到 2027 年,這波「實體書軍備競賽」會有三個必然結果。第一,合成數據(synthetic data)將從配角變主角:既然真實乾淨文本有限,模型就會開始用「高品質小樣本 + 合成擴增」的組合拳,市場報告也點名合成數據正快速補位;第二,稀有書危機惡化:被掃完即焚的絕版書可能真的從地球上消失,數位保存與國家圖書館的法定送存制度會被推上修法檯面;第三,合規成為新護城河:AI 訓練數據市場 2033 年將達 163 億美元量級,誰能端出「乾淨授權 + 可追溯來源」的數據,誰就能拿下企業客戶的信任票。
更深層的警訊在這裡:當「人類原創文本」變成戰略資源,AI 公司將不再只是數據使用者,而是數據壟斷者。未來的模型品質差距,可能取決於誰囤積了最多的「史前 AI 時代」文本——這比算力軍備競賽更隱蔽,也更難監管。2026 年的掃書潮,只是這盤大棋的第一步。
🟦 Pro Tip:企業導入 AI 時,把「訓練資料來源揭露」寫進合約條款。2027 年起,歐盟 AI 法案等監管框架只會愈收愈緊,現在就要求供應商白紙黑字承諾版權合規,等於替未來十年的法律風險買保險。
FAQ 常見問題
AI 公司為什麼要花大錢買實體書來訓練模型?
因為網路上的文本已被 AI 生成物大量污染,模型若拿「AI 生 AI」的資料繼續訓練會陷入模型崩潰。實體書(尤其 2022 年前出版、未數位化的書)是少數「純淨、未被 AI 污染」的高品質語料,掃描後銷毀還能確保數據獨佔,形成競爭護城河。
AI 公司掃描並銷毀書籍,作者能拿到賠償嗎?
可以。以 Bartz v. Anthropic 案為例,法院最終批准了 15 億美元和解,每部作品約賠償 3,000 美元,涵蓋逾 48 萬部作品。作者需查詢官方 Works List 並完成權益登記與申領,Meta 的 Kadrey 案則仍在訴訟中。
2027 年之後,AI 訓練數據還夠用嗎?
真實純淨文本會持續稀缺,產業將轉向「高品質小樣本 + 合成數據擴增」模式。全球 AI 訓練數據市場預計從 2026 年的約 39 億美元成長到 2033 年的 163 億美元,版權合規與數據溯源將成為新的競爭焦點。
你的企業也在用 AI,卻不確定手上的資料乾不乾淨?讓專業團隊幫你盤點訓練資料的版權履歷,避開下一個 15 億美元等級的坑。
📚 參考資料與權威文獻
- Washington Post:Anthropic「破壞性」掃描數百萬本書以訓練 Claude
- NPR:Anthropic 以 15 億美元和解作者訴訟(每本 3,000 美元)
- The Authors Guild:Bartz v. Anthropic 和解須知
- OpenClassActions:Anthropic 和解最終批准與付款時程
- Economic Times:AI 的數據飢渴正在吞噬稀有書籍
- Mashable:AI 公司購買並銷毀舊書以取得訓練數據
- Grand View Research:AI 訓練數據集市場報告 2026-2033
- The Society of Authors:Anthropic 被盜作品清單與索賠進度
Share this content:













