行情
…

谷歌 TPU 第 8 代為何拆分?8i 推理、8t 訓練差異與 Agent 如何重塑資料中心

谷歌 2026 年資本支出預計超過 2000 億美元,AI 基礎設施負責人 Amin Vahdat 指出服務側 token 產能約每六個月需翻倍,增長的主要驅動來自軟體與模型最佳化,其貢獻「很可能不輸硬體」。

谷歌 TPU 第 8 代為何拆分?8i 推理、8t 訓練差異與 Agent 如何重塑資料中心
目錄

谷歌 TPU 第 8 代為何拆分?8i 推理、8t 訓練差異與 Agent 如何重塑資料中心

重點摘要

  • 谷歌 2026 年資本支出預計超過 2000 億美元,AI 基礎設施負責人 Amin Vahdat 指出服務側 token 產能約每六個月需翻倍,增長的主要驅動來自軟體與模型優化,其貢獻「很可能不輸硬體」。
  • 第八代 TPU 今年首度拆成推理(8i)與訓練(8t)兩顆獨立晶片,直押推理在總算力需求占比升至 50% 以上;兩顆晶片均保留執行對方負載的「安全閥」,以防六年生命週期內需求預測失準。
  • 長程 agent(long-horizon agent)崛起讓請求密度跳升數量級,CPU、網路、儲存需求同步暴增,Goodput(有效算力產出)取代 FLOPS 成為衡量系統真實性能的關鍵指標。

2026 年 10 月 7 日,谷歌 AI 基礎設施負責人 Amin Vahdat 在接受 Sequoia Capital 合夥人 Sonia Huang 訪談時,梳理了這輪 AI 基建擴張背後的技術取捨。谷歌 2026 年資本支出預計超過 2000 億美元,大部分投入資料中心;服務側 token 產能大約每六個月需翻倍,且增長的主要驅動力是軟體與模型優化的持續疊加,Vahdat 指出其貢獻「很可能不輸硬體本身」。訪談中浮出兩個結構性訊號:第八代 TPU 今年首度把推理與訓練拆成兩顆獨立晶片,以及長程 agent 的興起正從根本改變資料中心的設計邏輯。

隨著長程 Agent 崛起與推理需求過半,AI 算力競賽正從單純堆疊理論峰值算力,轉向以有效算力產出為核心的系統級效率博弈。

Goodput 和 FLOPS 差在哪?

Vahdat 把 FLOPS 定性為虛榮指標。它測的是單顆晶片的理論峰值,但實際工作負載跑在數千乃至數萬顆加速器、CPU、網路、儲存的協同系統上,任何一個環節出問題,效能就大打折扣。差距落在哪裡?答案是回滾(rollback)。

同步工作負載中,只要有一個組件失敗,整批計算就可能退回上一個檢查點重跑。那些算錯後重來的計算消耗了真實的硬體資源,卻沒有交付任何有效輸出。Goodput 就是把這部分「無效功」扣掉後的有效產出,衡量的是系統在持續故障條件下真正能交付多少有效工作。Vahdat 直言:在十萬顆加速器的規模上,「故障是常態,而非例外」。

故障來源呈長尾分佈,從網路互連、硬體本身、編譯器缺陷到作業系統問題都有,每引入一代新產品就帶來新的故障模式。這意味著提高 Goodput 不是「找到根因修掉就好」的工程問題,而是系統可靠性的持續優化工作,沒有終點。對採購算力的工程師而言,只看 FLOPS 會系統性低估網路互連品質與軟體可靠度對整體有效產出的貢獻。這是 Vahdat 把「Goodput」當成對外問責指標的根本原因:FLOPS 是裝備清單,Goodput 才是戰果。

第八代 TPU 為何首度拆成 8i 和 8t?

谷歌今年發布的第八代 TPU 首度分拆為兩顆獨立晶片:8i 針對推理,8t 針對訓練。Vahdat 把這個決策直接連結到市場預判:推理在總算力需求中的占比,預計升至 50% 以上。

在此前的單晶片架構下,一顆晶片同時兼顧推理與訓練,兩類工作負載都無法優化到極致。推理占比一旦過半,繼續折衷的邊際成本就超過了靈活性帶來的好處,拆分的時機到了。拆分之後,設計上保留了一個關鍵彈性:8i 和 8t 都能執行對方的工作負載,但非專長方向性能會打折。Vahdat 解釋為何要留這條退路:假如 8i 完全不能做訓練,谷歌就必須在六年生命週期開始前精準預測兩類需求各占多少,那個預測風險難以承受。這個「安全閥」的設計,是在方向性押注與可修正彈性之間拿捏的工程取捨,也說明了「確定性押注」從來不是資本配置的好策略。

往更長的特殊應用晶片光譜看,Vahdat 描述了從通用 GPU,到把矩陣乘法、softmax 等 Transformer 核心原語固化進硬體,再到「把特定模型架構燒入晶片」的連續推進路徑。目前已有公司在探索最後一步,谷歌的判斷是:Transformer 所需的線性代數原語已基本固化,進一步專用到具體模型層「非常有趣,但尚未落地」。這條路走下去,理論上要求晶片廠商與模型架構的共同演進周期更緊密對齊,模型架構若能收斂,晶片投資的報酬才能最大化。

Agent 崛起後,CPU 機架和 GPU/TPU 機架該怎麼擺?

傳統的人機互動有個天然節流機制:使用者讀完回應、思考、再輸入,中間有數秒乃至數十秒的停頓,請求頻率自然受限。長程 agent 把這個節流閥拔掉了。模型不等人,回應延遲從秒級壓到毫秒級,請求密度跳升數量級。

加速器的需求自然在漲,但 agent 同時也大量消耗 CPU:解析上一步回應、決定下一步動作、從本機 DRAM、遠端記憶體、SSD 或 HDD 抓取上下文,這些操作全跑在 CPU 上,不在加速器上。CPU、網路、儲存的需求跟著同步暴增,資料中心不再只是加速器的組裝場所,這是 Vahdat 口中「傳統資料中心組件需求暴增」的具體來源。

這直接逼出了一個佈局兩難。若把大量 CPU 機架配在 GPU/TPU 機架旁,會破壞針對加速器的專用化設計;若把兩類機架分置在不同建築,樓間網路就引入數百微秒的排隊延遲,可靠性與成本壓力同步拉升。Vahdat 在訪談中把這個問題擺上台面,目前沒有收斂的答案。電力是更底層的約束,Vahdat 稱之為「最根本的長期瓶頸」,谷歌的因應則是與公用事業長期共同規劃。

算力的帳單正從「擁有多少理論算力」換算成「實際交付了多少有效算力」。第八代 TPU 的拆分,是推理市場規模達到可以專用化的臨界點後的合理應對;長程 agent 對 CPU 與網路的大量消耗,則讓資料中心的複雜性從晶片層擴散到整個技術棧。對供應鏈上的工程師和創業者而言,網路互連品質、CPU 佈局彈性、以及軟體可靠度,這些原本是基礎設施的背景因素,現在直接決定算力的真實帳單。

標籤

#谷歌 tpu 第8代#tpu 8i 8t 拆分#推理 訓練 晶片#amin vahdat 訪談#ai 資料中心 cpu 需求
→

繼續閱讀

查看全部 →
NewsAI 快訊

Gundlach 認為近期價格回檔正是長期分批買進的時機,一旦經濟衰退或美元走弱,黃金有望與商品、非美資產一起上漲。

Gundlach 不只質疑資產估值,更直接點出美元霸權可能正在動搖。

DeltaMedia 編輯部2 分鐘
NewsAI 快訊

Jump Trading 如何用 ChatGPT 擴張量化研究?AI 量化交易案例

Jump Trading 匯入 ChatGPT 輔助量化研究

DeltaMedia 編輯部2 分鐘
NewsAI 快訊

OpenAI 722 篇數學論文是什麼?破解多道未解難題與 Quasi-Riemann 懶人包

2026 年 10 月,OpenAI 從一個未公開的內部前沿模型釋出 722 篇數學手稿,按主題分為 372 個結果族,來自約 4,000 道研究問題的基準測試;模型本體不對外公開。

DeltaMedia 編輯部4 分鐘
NewsAI 快訊

AI 繁榮竟是全球未爆彈?IMF 示警:威脅程度堪比石油與債務危機

IMF 總裁 Kristalina Georgieva 在 2026 年 10 月 7 日公開將「失衡的 AI 繁榮」與能源衝擊、債務累積並列為威脅全球穩定的風險組合,標誌著 IMF 對 AI 基礎設施投資的總體經濟評估出現根本性轉折。

DeltaMedia 編輯部7 分鐘