News
Loading market feed...
News 快訊

Token 計價落伍了?OpenAI 攜手 Anthropic 掀定價革命:改按「任務」算帳

OpenAI 與 Anthropic 正推動產業將 AI 定價衡量標準從「每 Token 成本」轉向「每任務成本(cost-per-task)」,試圖幫高溢價模型重新定位價值。

DeltaMedia 編輯部 6 min 2026年8月14日
Token 計價落伍了?OpenAI 攜手 Anthropic 掀定價革命:改按「任務」算帳

Token 計價落伍了?OpenAI 攜手 Anthropic 掀定價革命:改按「任務」算帳

重點摘要

  • OpenAI 與 Anthropic 正推動產業將 AI 定價衡量標準從「每 Token 成本」轉向「每任務成本(cost-per-task)」,試圖幫高溢價模型重新定位價值。
  • 企業支出管理平台 Ramp 資料顯示,企業對 OpenAI 與 Anthropic 的採用已放緩,客戶正轉向更便宜的開源替代方案,Anthropic 最貴模型 Fable 5 僅佔其軟體支出 11%。
  • 儘管 Meta 與 SpaceX 以極低 Token 價格擠壓市場,分析師認為開源 Token 如同廉價衛生紙,雖能用但需更多用量且有副作用,企業開始尋求第三方獨立評估以解決自報資料的比較困境。

2026 年 7 月,OpenAI 財務長 Sarah Friar 在部落格發文,點出 AI 定價邏輯的轉折點。她指出,低成本模型的 Token 雖然便宜,但要得到好結果可能需要更多嘗試、更多時間或更多人工審查;能力更強的模型 Token 更貴,卻能一次完成同一任務。這套說法與 Anthropic 金融服務主管 Jonathan Pelosi 的觀點一致。Pelosi 表示,Token 成本只是衡量消耗了多少 AI 算力的「代理指標」,對企業來說,更好的代理指標是完成任務的實際成本。這兩家美國 AI 龍頭相繼發聲,試圖在企業客戶面前重新定位高溢價模型的價值,將衡量標準從「每 Token 成本」轉向「每任務成本」。但說服市場並不容易,因為此時 Token 單價的地板正被競爭對手不斷踩低。

面對開源模型與低價 Token 的市場夾擊,OpenAI 與 Anthropic 正試圖重塑 AI 的價值度量衡,引導企業從關注單一 Token 價格轉向評估完成任務的總體成本。

這場定價爭議的背景,是 Meta、SpaceX 等廠商正以極低的 Token 價格擠壓市場,給 Anthropic 等高價模型廠商帶來競爭壓力。DeepSeek 於 2026 年 4 月發布的旗艦開源模型,其輸入輸出 Token 成本僅為 Anthropic 最先進產品的零頭。在這樣的市場環境下,企業支出管理平台 Ramp 的資料揭示了客戶行為的改變:近幾個月企業對 OpenAI 與 Anthropic 的採用已有所放緩,現有客戶正越來越多轉向更便宜的開源替代方案。這筆資料指向一個更具體的問題,願意付高價的企業,究竟願意付到哪裡?

Ramp 的資料進一步顯示,Anthropic 最強且最貴的廣泛可用模型 Claude Fable 5,僅佔其 Claude 軟體總支出的 11%。Ramp 據此斷言,透過 Fable 5 已找到企業願意為 AI 付費的新上限,在此之上,更高的效能並不值這個價。按每任務成本計,Claude Fable 5 仍是市場上最貴的廣泛可用模型,但 OpenAI 與 Anthropic 也同時提供更具競爭力的低價產品,如 OpenAI 的 GPT-5.6 Luna,以應對市場對成本的敏感。換句話說,兩家廠商一邊推「每任務成本」論述,一邊又在低端市場提供更有競爭力的低價選項,市場對單一模型效能溢價的支付意願,看起來已觸及天花板。便宜的 Token 是否等於便宜的結果,是 D.A. Davidson 技術與研究主管 Gil Luria 最想正面回答的問題。

Gil Luria 用衛生紙描述開源 Token 的困境:廉價衛生紙確實能擦乾淨,但你需要更多,還有別的不愉快副作用。他進一步指出,過去鼓勵員工透過「Tokenmaxxing」最大化使用 AI 的企業,在遭遇帳單衝擊後紛紛為內部 AI 使用設限,因為內部成本已高得令人望而卻步。低 Token 單價帶來的隱形成本包含效率損失與管理負擔,讓「每任務成本」這個衡量指標顯得更有說服力。然而,誰來負責算出這個數字,又成了另一個難題。

市場對實驗室自報資料的信任度正在下降。越來越多企業客戶轉向 Artificial Analysis、Vals AI 等第三方基準測試機構,尋求獨立的每任務成本評估,以替代實驗室自報資料。Vals AI 共同創辦人兼 CEO Rayan Krishnan 點出了核心問題:當實驗室自報結果時,往往用的是內部基準,因此無法做真正的同類比較。他的話揭示了一個方法論困境,就算企業接受「每任務成本」這個框架,基準怎麼設、任務怎麼定義,各方仍各說各話。這對 Anthropic 的整體商業策略而言,並非中立的技術細節。

從更宏觀的產業策略來看,Anthropic 共同創辦人兼執行長 Dario Amodei 的立場與這場定價爭議直接相關。Amodei 明確表示,寧要最高收入而非最大資料中心,因為前者盈利、後者虧損。這個取捨與競爭對手以算力投入換估值的策略形成對比,也讓「每任務成本」論述有了商業邏輯:只要企業相信高價模型最終更省錢,Anthropic 就能在不燒資本擴大算力的情況下守住定價。只是市場的懷疑還沒消散。

Token 單價持續下探是行業事實,但便宜不等於划算。Ising Research 先前分析指出,即使執行力與資源都不是問題的大型企業,也在投資報酬率上卡關。單純的 Token 價格下降,並未自動轉化為企業投資報酬率的提升。企業面對低價開源模型與高價閉源模型,選的不是哪個數字比較小,而是效率、可靠性與總體成本之間的完整算術。OpenAI 與 Anthropic 推動的「每任務成本」指標,正是試圖把這道複雜的算術壓進同一個可比較的數字裡。

但一旦「每任務成本」成為主流指標,「任務」本身的定義就變成了爭議點。不同企業、不同應用場景對任務邊界的劃法可能截然不同,這讓 Artificial Analysis 與 Vals AI 等第三方評估機構的角色更吃重,評估複雜度也同步升高。此外,Ramp 資料顯示的 Fable 5 支出佔比僅 11%,也暗示企業可能已在採用混合策略,按任務型態把工作分配給不同性價比的模型,而非押注單一旗艦。

技術背景的創業者與工程師面臨的,是架構選擇邏輯的整體改變,不只是換個計價標準。過去評估模型通常從 Token 價格與延遲出發,現在還要考慮模型在特定任務上的成功率、人工審查需求,以及整體工作流程的效率損耗。對準確度要求高、人工複核成本貴的任務,高價模型的算術通常站得住;能接受容錯、透過批次處理補足效率的任務,低價開源模型則更合適。這要求開發者先搞清楚業務場景的成本結構,才能做出有意義的選擇。

Sarah Friar 7 月那篇部落格文章的核心論點其實很簡單:Token 便宜不等於結果便宜。這個論點從定價問題延伸出去,已在影響企業採購的判斷框架、模型評估的方法論,以及技術架構的選型邏輯。Ramp 資料顯示的 11%、Vals AI 的崛起、Rayan Krishnan 指出的比較困境,都在說明同一件事:「每任務成本」作為概念可能站得住,但要成為企業能實際依賴的指標,還需要一套各方都能接受的任務定義與評估標準。在那把尺出現之前,市場會繼續用自己的演算法做選擇,高價模型的價值主張也仍需在每一筆採購決策裡重新證明一次。

繼續閱讀