中國大模型如何賺錢?高盛上調 ARR 預期,性价比與能力雙升全解讀
8 月 3 日,高盛亞太分析師 Ronald Keung 將中國大模型廠商 2026 年末合計 ARR(年度經常性收入)預期從 100 億美元上調至 130 億美元,2030 年預測達 1250 億美元(五年 25 倍);同日 Jefferies 週報指出 OpenRouter 呼叫量前五連續 14 週全由中國模型包攬。
目錄

重點摘要
- 8 月 3 日,高盛亞太分析師 Ronald Keung 將中國大模型廠商 2026 年末合計 ARR(年度經常性收入)預期從 100 億美元上調至 130 億美元,2030 年預測達 1250 億美元(五年 25 倍);同日 Jefferies 週報指出 OpenRouter 調用量前五連續 14 週全由中國模型包攬。
- DeepSeek V4 Flash 輸入定價 0.14 美元/百萬 token,快取命中只收定價的 2%,對比 GPT-5.5 的 5 美元差距超過 35 倍;一名 Agent 開發者每日算力成本從美國頂尖模型的 52-104 美元降至 13 美元(4-8 倍差距)。
- 中美頂尖模型性能差距縮至約 2.7%(一年前仍是兩位數),GLM-5.2 進入代碼與 agent 全球前七;能力追平讓「足夠便宜」從折衷方案升格為合理首選。
8 月 3 日,高盛亞太網際網路團隊分析師 Ronald Keung 發布最新研報,把中國大模型廠商 2026 年末合計 ARR 預期從 100 億美元上調至 130 億美元,並預測 2030 年將攀升至 1250 億美元,相當於五年 25 倍的成長幅度。同一天,Jefferies 的週報用另一組數字呼應這個方向:OpenRouter 平台全球大模型調用量前五,連續 14 週全部由中國模型包攬,其中 DeepSeek V4 Flash 單週吞吐 7.22 兆 token 登頂全球。一份報告上調了預期,另一份報告呈現了流量結構,兩者指向同一個正在發生的轉折:中國大模型從「性價比故事」切換到「收入兌現故事」,而且轉換速度比華爾街此前預判的更快。
高盛為何把 ARR 預期上調 30%?
上調的理由,高盛集中在兩件事:個別廠商商業化執行力超出預期,以及市場結構出現雙層分化。個別廠商方面,高盛對智譜(Zhipu)的收入預期上調 35%,對 MiniMax 的調幅達到 22% 至 64%,這種幅度反映出市場對他們能否把產品賣出去的看法,在短期內發生了根本性修正。在總量層面,高盛預測中國大模型 API 與訂閱收入將從 2026 年的人民幣 350 億元成長至 2030 年的人民幣 8790 億元,同期每日 token 消耗量從 350 兆增至 4600 兆,兩個指標以相近速率同步放大,顯示收入成長主要由使用量驅動,而非定價提升。
高盛把這個市場劃成「雙層結構」:高端市場以智譜 GLM-5.2 和阿里 Qwen3.7 Max 為代表,定價約 1 美元/百萬 token,賣的是強推理和長程規劃帶來的智能溢價;低端市場面向 Agent 任務,定價落在 0.06 至 0.2 美元/百萬 token,靠大量調用攤薄邊際成本。這個雙層結構的關鍵在於:中國大模型不是只靠低價打市場,而是同時在高端用能力、在低端用規模兩條路同時走。對開發者和創業者而言,搞清楚自己的應用落在哪一層,才看得懂不同廠商的定位邏輯和商業化策略。
35 倍的價差怎麼算出來的?
具體數字先放上來。DeepSeek V4 Flash 輸入定價 0.14 美元/百萬 token,GPT-5.5 的對應報價是 5 美元,差距超過 35 倍。高盛用一個 Agent 開發者的日常成本作對照:每日消耗約 709 萬 token,跑在美國頂尖模型上,單日算力費用為 52 至 104 美元;換到中國頭部模型,同樣的工作量只需 13 美元。4 到 8 倍的差距,大到讓「為何不切換」變成一個需要向財務長作出合理解釋的問題,而不只是工程師的技術偏好。
底層是架構選擇帶來的系統性優勢。中國模型普遍採用 MoE(Mixture of Experts,混合專家)架構,推理時只啟動總參數量的一小部分,每次推理的計算量遠低於同規模的稠密模型,推理成本因此大幅壓低。DeepSeek 的快取定價設計進一步拉開差距:快取命中只收定價的 2%,而業界通行的快取折扣大多只打到九折,換言之命中快取後仍然要付 90% 的費用。Agent 工作流中,系統提示、工具規格這類固定上下文的快取命中率通常很高,這意味著大量重複上下文的實際有效成本可以再往下掉接近一個數量級,遠超帳面定價已呈現的 35 倍差距。然而這一切的前提是:低價要能持續吸引流量,模型的能力本身必須同時過關。工具調用失敗率高、長上下文記憶不穩定的便宜模型,Agent 開發者很快就會放棄,OpenRouter 連續 14 週的榜首格局不是純靠定價能解釋的。
能力差距縮到多小了?
斯坦福 AI Index 的統計給了一個整體座標:中美頂尖模型性能差距目前約 2.7%,而一年前這個數字還在兩位數。壓縮發生的主要場景,正是技術難度最高的幾個方向。高盛把中國大模型的發展節點劃成兩個:2025 年是「DeepSeek 時刻」,MoE 架構的大規模普及把推理成本系統性壓低,核心優勢在成本;2026 年是「智譜時刻」,GLM-5.2 在代碼生成和 agent 等高技術含量的場景進入全球第一梯隊,能力的故事才開始說得通。三個月內,進入全球文字模型前 50% 的中國新模型增加了 13 款,進入代碼領域前 30% 的新增 5 款,agent 領域更從零突破,GLM-5.2 穩居全球前七。在 Artificial Analysis 的影片模型排名中,MiniMax H3 的影片編輯能力目前排名全球第一,字節跳動 Seedance 在多模態生成同樣位居領先梯隊。
架構創新是能力追平的基礎,而且低成本和高能力在設計上並不互相排斥。MiniMax 在 M3 模型中推出 MSA(Mixed Sparse Attention,混合稀疏注意力)架構,把 1M 超長上下文的處理成本壓到傳統注意力架構的極低水準,同時在 Coding 和 Agent 基準測試中拿下全球前列的排名。美團 LongCat 2.0 在 5 萬張國產算力卡上完成 1.6 兆參數的全量訓練,驗證了國產軟硬體協作堆疊的實際競爭力。MoE 架構的本質是稀疏激活壓低推理計算量,但總參數量可以做很大,模型容量不必犧牲,這才是低成本與高能力同時成立的技術基礎。對 Agent 應用而言,一次工作流跑數百次工具調用,指令追蹤、長上下文記憶、錯誤恢復缺一不可;中國模型目前看來正在同時達到這兩個條件,這才是流量結構改變的根本原因。
全行業仍在虧損,盈利拐點在哪裡?
高盛在看好長期增長的同時,沒有迴避短期的財務現實。2026 年全行業預估訓練成本約 40 億美元、推理成本約 70 億美元,合計 110 億美元,高於同期 130 億美元的 ARR,意味著整個板塊仍處於負 EBIT 狀態。API 業務毛利率目前只有 20% 至 30%,距離真正獲利還有一段路。盈利拐點,高盛設在 2030 年:預計屆時板塊 EBIT 利潤率達 18%,對應總利潤約 230 億美元。路徑邏輯是先燒錢奪市佔、推理成本隨規模下降後毛利率才跟上來。
快取定價極薄的設計,這裡藏著一個值得追蹤的張力。快取命中只收 2% 的策略對開發者吸引力極大,但這部分流量對廠商的實際毛利貢獻也極薄。如果 Agent 工作流大量命中快取,token 消耗量快速放大,收入增長速度未必等比跟上,「消耗 25 倍就代表收入 25 倍」的換算比高盛假設的可能更複雜。這是從定價機制推衍出的疑慮,值得獨立追蹤。從 Chat 到 Work 的 token 消費轉移,是驅動整個增長故事的底層力量:一個 Agent 跑一趟複雜工作流,token 消耗量輕鬆超過一個人類使用者一週的對話量。OpenRouter 週報(7 月 27 日至 8 月 2 日)前三名分別是 DeepSeek V4 Flash 的 7.22 兆、小米 MiMo-V2.5 的 6.3 兆、騰訊混元 Hy3 的 4.82 兆,這種量級不是對話流量能解釋的,背後是 Agent pipeline 在並行執行大量任務,把每位使用者的月消耗量從個位數美元推到每日數十美元。
接下來真正值得盯著看的,是哪些廠商能在高端市場靠能力站穩溢價定位、同時在低端靠規模壓低單位成本,還是兩種商業邏輯的內在張力最終讓市場分化成截然不同的兩條產品路線,而 2030 年的盈利拐點屆時從哪一層先兌現。
常見問題
DeepSeek 快取命中只收 2%,和業界通行折扣差多少?
業界通行的快取折扣大多是九折,快取命中後仍收 90% 的定價。DeepSeek 只收 2%,差距約 88 個百分點。Agent 工作流中系統提示和工具規格等固定上下文重複讀取頻率高,快取命中率通常很高,這意味著大量請求的實際有效成本可以再往下掉接近一個數量級,遠超帳面的 35 倍定價差距。
中美頂尖模型差距縮至 2.7%,代表中國模型在所有任務上都追上了嗎?
這個 2.7% 是斯坦福 AI Index 對頂尖模型的整體性能比較,不代表每個子任務都均等。高盛的評估顯示,在基礎文字任務方面智譜和 DeepSeek 表現最突出;在 Agent 工具調用和代碼生成方面,阿里 Qwen3-Max 目前位居全球第一梯隊。整體差距縮小,但各廠商在不同場景仍有明顯強弱差異,選型時還是要對應具體任務實測。
高盛預測 2030 年盈利拐點,這個時間表可信嗎?
高盛的盈利路徑建立在 token 消耗和收入同步 25 倍增長、推理成本隨規模下降後毛利率跟上的假設上,2026 年全行業合計訓練加推理成本已超過 ARR,板塊整體仍在虧損,2030 年是長期目標而非短期可驗證的數字。快取定價極薄帶來的毛利壓力、競爭加劇下的定價空間,都可能讓毛利率改善速度比預期慢,盈利拐點延後的可能性不能排除。
標籤


