News
Loading market feed...
News 快訊

AI 語料枯竭是什麼?數據瓶頸、模型坍縮與訓練數據版權授權的新經濟學

2026 年 7 月 20 日,Anthropic 以 15 億美元和解版權侵權訴訟,涵蓋約 48.2 萬至 50 萬部作品,摺合每部約 3,000 美元,是美國版權史上迄今規模最大的和解金額。

DeltaMedia 編輯部 8 min 2026年8月17日
AI 語料枯竭是什麼?數據瓶頸、模型坍縮與訓練數據版權授權的新經濟學
目錄

AI 語料枯竭是什麼?數據瓶頸、模型坍縮與訓練數據版權授權的新經濟學

重點摘要

  • 2026 年 7 月 20 日,Anthropic 以 15 億美元和解版權侵權訴訟,涵蓋約 48.2 萬至 50 萬部作品,折合每部約 3,000 美元,是美國版權史上迄今規模最大的和解金額。
  • Epoch AI 等機構預測,高質量公開文本資料可能在 2020 年代中後期至 2030 年代初出現明顯短缺;算力有摩爾定律,資料的生產速率沒有。
  • 從擁有版權到供應可用的訓練語料,中間隔著確權、清洗、標注、垂類加工等大量工程成本;多數通俗版權內容單 token 價值極低,只有專業稀缺垂類語料才可能獲得顯著溢價。

2026 年 7 月 20 日,加州北區聯邦法院法官 Araceli Martínez-Olguín 簽署最終批准令,核准 Anthropic 以 15 億美元和解版權侵權指控,涵蓋約 48.2 萬至 50 萬部作品,折合每部約 3,000 美元。事件起因是 Anthropic 被指控從 LibGen 等盜版資源庫下載超過 700 萬本電子書用於模型訓練,遭作者群體集體起訴。訊息公布後,A 股 AI 語料板塊集體拉升,讀客文化觸及漲停,中信出版、中國出版等版權標的跟漲。資本追逐的理由很簡單:AI 大模型的訓練資料快不夠用了。

當算力擴張遭遇高質量人類語料枯竭的物理極限,AI 產業的瓶頸正從晶片轉向數據,而內容產業的定價權,將不取決於版權的擁有量,而取決於將版權轉化為可訓練數據集的工程能力。

算力跑在摩爾定律上,資料跑在哪裡?

訓練資料的消耗量幾乎與模型規模同步膨脹。GPT-2 的訓練資料是數十 GB 量級,GPT-3 跳到數百 GB,當前大模型參數從千億衝向萬億,吞吐的語料體積也以相同速率放大。Epoch AI 等研究機構的預測是,高質量公開文本在 2020 年代中後期至 2030 年代初將出現明顯短缺。

問題的根本不對稱在這裡:算力有摩爾定律,製程進步每幾年把算力密度翻倍、成本砍半,節奏穩定可預測。但語言文本的生產速率受限於人類書寫速度,沒有類似的自然加速機制。國家資料局局長劉烈宏在 2026 世界智能產業博覽會上的描述,把這個邏輯說得直接:AI 競爭力不在爐子多大,而在礦石品位有多高。等大模型用盡網際網路上所有高質量的自然人類書寫,下一批原生語料去哪裡找?

多模態的需求讓缺口更難填。2026 機器人全產業鏈年會披露的數字顯示,讓具身智慧達到實用能力,至少需要 1,000 萬小時量級的多模態資料,而貴州省大數據局的公開資料顯示,目前國內真實物理互動場景的合規資料僅 50 萬小時,缺口超過 99%。文字語料短缺只是第一波,多模態資料的缺口更大,而且短期內找不到快速補充的方法。更棘手的是,網路上新產出的文字中,AI 生成的比例越來越高。這些二手內容一旦混入下一批訓練資料,可能會讓優質的原生文字更難取得。

AI 生成資料的回旋鏢效應有多嚴重?

學界把最壞情境稱為模型坍縮:用 AI 生成的二手資料反復迭代訓練,模型會逐漸偏離真實世界的分佈,對罕見事件的理解能力萎縮。原理類似用複印件去複印複印件,每一代丟失細節,幾輪之後面目全非。

但學界對「嚴重性」仍有分歧。現有研究指出,不加篩選、大規模使用純 AI 生成資料循環訓練,才會誘發嚴重坍縮。嚴格過濾、去重、混合原生人類資料訓練,都能有效抑制退化。AI 生成內容本身不是毒藥,關鍵在於怎麼篩選與管理。

這也讓科技公司回頭挖掘「前 AI 時代」的原生文字資產。Anthropic 自 2024 年啟動了代號「巴拿馬計劃」的圖書數位化專案,目標是系統性掃描實體書籍以獲取乾淨的原生語料。內部文件對這個計劃的描述是「破壞性掃描世界上所有書籍」,並明確寫道不希望外界知情。

版權授權市場正在成形,但定價遠比看起來複雜

從和解金額回推,15 億美元換到約 50 萬部作品,每部 3,000 美元。但要解讀這個數字,必須先釐清訴訟背景與授權用途的差異。

首先,這個價格來自訴訟和解,不代表常態的市場定價。幾筆有跡可查的市場交易可以對照:HarperCollins 與 Microsoft 的精選非虛構圖書訓練授權,單本三年授權總價 5,000 美元,出版社與作者各拿一半,且限定部分舊書書目、設有文本引用比例上限、採作者自願選擇加入模式;Taylor & Francis 達成 1,000 萬美元的學術內容授權協議。條件各異,不是統一規格的市場報價。

此外,訓練用途與 RAG 用途的價格也有很大差距。AI 企業採購版權文本有兩條截然不同的路:一是用於模型預訓練或 SFT 微調,二是僅用於上線後的 RAG 知識庫。兩者的法律授權範圍和商業定價完全不同,不能簡單預期所有版權內容都能按訓練語料的高單價出售。目前不少 AI 企業採購版權文本只做檢索,不做訓練,這條分野在採購談判中非常關鍵。

MarketIntelo 預測,至 2034 年全球訓練資料授權市場規模將達 226 億美元,但這個口徑涵蓋多類型訓練資料集,不限於文字版權內容。興業證券的研究報告指出,AI 正在推動傳媒內容產業改變,從單純的消費品轉向「資料與 IP 資產」的雙重定價模式。但這個判斷要落地,需要配套的確權、交易、溯源體系同步成熟,目前仍在早期。

這裡有一個法律觀點值得單獨說清楚。Anthropic 案中,退休法官 William Alsup 在簡易判決意見中提出,合法購入的圖書掃描後用於內部模型訓練具備轉換性使用特徵,屬於合理使用範疇。這個觀點雖然常被媒體引用,但有兩個限制。一來這只是地區法院的審前意見,案件最後和解、沒有進入上訴程序,因此在美國全境沒有約束力;二來這套邏輯根植於美國版權體系,無法直接套用到其他國家的法律框架中。

有版權不等於有定價權:從粗礦到精礦的距離

即便原生文本供給真的趨緊,AI 公司不會被動等待出版社掌握主導權。替代路徑已經在收縮語料緊缺的邊界。

在數學、程式等結構清晰的領域,高質量合成資料可以部分替代人類資料,降低對原生文本的依賴。MoE 等架構改進,讓同等能力所需的原始資料量下降。RAG 普及後,大模型不需要在預訓練時把所有知識塞進參數,推理時按需從外部知識庫檢索就能補位。AI 公司還有其他選項:自建標注團隊、採購專業資料服務商、爬取開放合規的公共資料集,或直接簽約作者繞過出版商。傳統圖書版權是語料來源之一,不是唯一出路。

這意味著,手握版權不等於手握議價權,版權方與大模型廠商之間還隔著一道高聳的工程門檻。數位化、資料清洗、確權、標注、去重、脫敏、格式轉換,以及針對特定垂類的深層加工能力,每一環都是實際成本。中文語料的挑戰尤其複雜:版權歸屬往往不清晰,資料分散在各個機構,流通機制不成熟,很多資料「有,但難合規流通」。出版機構有內容資產,但不一定有資料工程能力;資料工程能力強的公司,不一定有獨家稀缺的垂類語料。兩者的結合點,才是真正稀缺的位置。

目前看來,版權語料市場不太可能讓版權方通吃,而是看誰能先建立起從「粗礦」到「可訓練資料集」的完整加工流程。對工程師和創業者而言,版權是入場券,資料工程才是正題。

常見問題

Anthropic 15 億美元和解,代表訓練用途的書籍每本市場價約 3,000 美元嗎?
不代表常態市場定價。15 億美元是訴訟和解的金額,不是出版社自願開價的結果。HarperCollins 的另一筆授權顯示,三年單本授權是 5,000 美元,但附帶自願選擇加入、引用比例上限等特定條件。海外多筆授權案例都帶有訴訟背景,價格不宜直接作為正常市場定價的參照。

William Alsup 的合理使用意見,是否確立了「買到的書可以用來訓練 AI」在美國合法?
不是確立的判例。Alsup 的意見是地區法院審前的簡易判決觀點,案件以和解收尾、未進入上訴程序,不構成在美國全境具約束力的先例。此外,這套法律邏輯根植於美國版權體系,不能直接套用至中國著作權法律框架。

手上有版權庫的機構,現在是否應該積極切入 AI 語料授權市場?
取決於版權內容的稀缺性和機構自身的資料工程能力。多數通俗文本的單 token 價值很低,高溢價集中在專業、獨家、稀缺垂類語料。僅有版權庫而缺乏清洗、標注、確權能力的機構,變現空間有限。可行的路徑是先建立從版權內容到可授權資料集的加工能力,再談定價。

標籤

#ai 語料 短缺 #模型坍縮 #anthropic 版權和解 #ai訓練資料 授權 #合成資料

繼續閱讀