谷歌 TPU 第 8 代為何拆分?8i 推理、8t 訓練差異與 Agent 如何重塑資料中心
谷歌 2026 年資本支出預計超過 2000 億美元,AI 基礎設施負責人 Amin Vahdat 指出服務側 token 產能約每六個月需翻倍,增長的主要驅動來自軟體與模型最佳化,其貢獻「很可能不輸硬體」。
目錄

重點摘要
- 谷歌 2026 年資本支出預計超過 2000 億美元,AI 基礎設施負責人 Amin Vahdat 指出服務側 token 產能約每六個月需翻倍,增長的主要驅動來自軟體與模型優化,其貢獻「很可能不輸硬體」。
- 第八代 TPU 今年首度拆成推理(8i)與訓練(8t)兩顆獨立晶片,直押推理在總算力需求占比升至 50% 以上;兩顆晶片均保留執行對方負載的「安全閥」,以防六年生命週期內需求預測失準。
- 長程 agent(long-horizon agent)崛起讓請求密度跳升數量級,CPU、網路、儲存需求同步暴增,Goodput(有效算力產出)取代 FLOPS 成為衡量系統真實性能的關鍵指標。
2026 年 10 月 7 日,谷歌 AI 基礎設施負責人 Amin Vahdat 在接受 Sequoia Capital 合夥人 Sonia Huang 訪談時,梳理了這輪 AI 基建擴張背後的技術取捨。谷歌 2026 年資本支出預計超過 2000 億美元,大部分投入資料中心;服務側 token 產能大約每六個月需翻倍,且增長的主要驅動力是軟體與模型優化的持續疊加,Vahdat 指出其貢獻「很可能不輸硬體本身」。訪談中浮出兩個結構性訊號:第八代 TPU 今年首度把推理與訓練拆成兩顆獨立晶片,以及長程 agent 的興起正從根本改變資料中心的設計邏輯。
隨著長程 Agent 崛起與推理需求過半,AI 算力競賽正從單純堆疊理論峰值算力,轉向以有效算力產出為核心的系統級效率博弈。
Goodput 和 FLOPS 差在哪?
Vahdat 把 FLOPS 定性為虛榮指標。它測的是單顆晶片的理論峰值,但實際工作負載跑在數千乃至數萬顆加速器、CPU、網路、儲存的協同系統上,任何一個環節出問題,效能就大打折扣。差距落在哪裡?答案是回滾(rollback)。
同步工作負載中,只要有一個組件失敗,整批計算就可能退回上一個檢查點重跑。那些算錯後重來的計算消耗了真實的硬體資源,卻沒有交付任何有效輸出。Goodput 就是把這部分「無效功」扣掉後的有效產出,衡量的是系統在持續故障條件下真正能交付多少有效工作。Vahdat 直言:在十萬顆加速器的規模上,「故障是常態,而非例外」。
故障來源呈長尾分佈,從網路互連、硬體本身、編譯器缺陷到作業系統問題都有,每引入一代新產品就帶來新的故障模式。這意味著提高 Goodput 不是「找到根因修掉就好」的工程問題,而是系統可靠性的持續優化工作,沒有終點。對採購算力的工程師而言,只看 FLOPS 會系統性低估網路互連品質與軟體可靠度對整體有效產出的貢獻。這是 Vahdat 把「Goodput」當成對外問責指標的根本原因:FLOPS 是裝備清單,Goodput 才是戰果。
第八代 TPU 為何首度拆成 8i 和 8t?
谷歌今年發布的第八代 TPU 首度分拆為兩顆獨立晶片:8i 針對推理,8t 針對訓練。Vahdat 把這個決策直接連結到市場預判:推理在總算力需求中的占比,預計升至 50% 以上。
在此前的單晶片架構下,一顆晶片同時兼顧推理與訓練,兩類工作負載都無法優化到極致。推理占比一旦過半,繼續折衷的邊際成本就超過了靈活性帶來的好處,拆分的時機到了。拆分之後,設計上保留了一個關鍵彈性:8i 和 8t 都能執行對方的工作負載,但非專長方向性能會打折。Vahdat 解釋為何要留這條退路:假如 8i 完全不能做訓練,谷歌就必須在六年生命週期開始前精準預測兩類需求各占多少,那個預測風險難以承受。這個「安全閥」的設計,是在方向性押注與可修正彈性之間拿捏的工程取捨,也說明了「確定性押注」從來不是資本配置的好策略。
往更長的特殊應用晶片光譜看,Vahdat 描述了從通用 GPU,到把矩陣乘法、softmax 等 Transformer 核心原語固化進硬體,再到「把特定模型架構燒入晶片」的連續推進路徑。目前已有公司在探索最後一步,谷歌的判斷是:Transformer 所需的線性代數原語已基本固化,進一步專用到具體模型層「非常有趣,但尚未落地」。這條路走下去,理論上要求晶片廠商與模型架構的共同演進周期更緊密對齊,模型架構若能收斂,晶片投資的報酬才能最大化。
Agent 崛起後,CPU 機架和 GPU/TPU 機架該怎麼擺?
傳統的人機互動有個天然節流機制:使用者讀完回應、思考、再輸入,中間有數秒乃至數十秒的停頓,請求頻率自然受限。長程 agent 把這個節流閥拔掉了。模型不等人,回應延遲從秒級壓到毫秒級,請求密度跳升數量級。
加速器的需求自然在漲,但 agent 同時也大量消耗 CPU:解析上一步回應、決定下一步動作、從本機 DRAM、遠端記憶體、SSD 或 HDD 抓取上下文,這些操作全跑在 CPU 上,不在加速器上。CPU、網路、儲存的需求跟著同步暴增,資料中心不再只是加速器的組裝場所,這是 Vahdat 口中「傳統資料中心組件需求暴增」的具體來源。
這直接逼出了一個佈局兩難。若把大量 CPU 機架配在 GPU/TPU 機架旁,會破壞針對加速器的專用化設計;若把兩類機架分置在不同建築,樓間網路就引入數百微秒的排隊延遲,可靠性與成本壓力同步拉升。Vahdat 在訪談中把這個問題擺上台面,目前沒有收斂的答案。電力是更底層的約束,Vahdat 稱之為「最根本的長期瓶頸」,谷歌的因應則是與公用事業長期共同規劃。
算力的帳單正從「擁有多少理論算力」換算成「實際交付了多少有效算力」。第八代 TPU 的拆分,是推理市場規模達到可以專用化的臨界點後的合理應對;長程 agent 對 CPU 與網路的大量消耗,則讓資料中心的複雜性從晶片層擴散到整個技術棧。對供應鏈上的工程師和創業者而言,網路互連品質、CPU 佈局彈性、以及軟體可靠度,這些原本是基礎設施的背景因素,現在直接決定算力的真實帳單。
標籤



