News
Loading market feed...
News 快訊

千問釋出 Qwen3.8-Max,阿里把戰場推向長週期 Agent

阿里巴巴於 2026 年 8 月 3 日釋出 Qwen3.8-Max,參數規模達 2.4 兆,支援 100 萬 Token 上下文,API 定價為每百萬 Token 輸入 12 元、輸出 36 元。

DeltaMedia 編輯部 5 min 2026年8月4日
千問釋出 Qwen3.8-Max,阿里把戰場推向長週期 Agent
目錄

千問釋出 Qwen3.8-Max,阿里把戰場推向長週期 Agent

重點摘要

  • 阿里巴巴於 2026 年 8 月 3 日釋出 Qwen3.8-Max,參數規模達 2.4 兆,支援 100 萬 Token 上下文,API 定價為每百萬 Token 輸入 12 元、輸出 36 元。
  • 在科研程式設計 PaperBench 基準測試中得分從 64.8 分躍升至 93 分,但在 SWE-bench Pro 真實軟體工程基準測試中得 67.7 分,仍低於 Fable 5 與 Claude Opus 4.8。
  • 開發者實測顯示模型在長週期任務中仍存在「懶惰」與執行偏差問題,行業觀點認為長週期能力成熟度需結合人工接管頻次與算力成本綜合評估。

2026 年 8 月 3 日,阿里巴巴在預熱兩週後正式發表 Qwen3.8-Max。這款參數規模達到 2.4 兆的模型,支援最長 100 萬 Token 上下文,重點提升程式設計、辦公、科研和長週期任務能力。千問在 7 月 19 日預覽版上線時曾宣稱,該模型正以「天」為單位持續進化,並直言「可能是除了 Fable 5 以外最強大的模型」。此次發表不再將智譜、月之暗面、深度求索等中國廠商列入對標名單,僅剩 OpenAI 和 Anthropic 的旗艦模型作為比較對象。隨著 Kimi K3 和 DeepSeek V4 即將發表,中國 AI 模型競爭將進一步加劇,阿里試圖用 Qwen3.8-Max 確立其在高端市場的定位。

阿里巴巴發表 Qwen3.8-Max 確立其在高端市場的定位,試圖以科研程式設計與長週期 Agent 任務能力,在與國際頂尖模型的對標中突圍,但實際工程化落地與交付穩定性仍面臨開發者實測的考驗。

Qwen3.8-Max 的效能表現究竟如何?

在官方 PaperBench 科研程式設計基準測試中,Qwen3.8-Max 得分從上代 64.8 分大幅躍升至 93 分。在 Agents' Last Exam Agent 能力基準測試中,其任務通過率也從 11.8% 升至 27%。然而,在 SWE-bench Pro 真實軟體工程基準測試中,Qwen3.8-Max 得到 67.7 分,比 Fable 5 低 12.3 分,也略低於 Claude Opus 4.8 的 69.2 分。

在 Arena 榜單中,Qwen3.8-Max 在視覺榜單排名第二,與榜首相差 13 分;在文本榜單排名第五,與榜首同樣相差 13 分。在前端程式碼榜單中,它排名第四,比榜首的 Opus 5-Max 低 37 分。上代 Qwen3.7-Max 於 2026 年 5 月 20 日發表,曾位列 Code Arena 第四、中國模型第一,並在 Text Arena 一度排名第六。此次 Qwen3.8-Max 的對標名單縮減,看得出阿里對自家模型實力的自信,但也暴露出在部分垂直領域與國際頂尖模型仍有差距。

長週期任務能力是噱頭還是實質突破?

千問展示的長週期任務案例為:Qwen3.8-Max 連續執行約 16 天,從零構建開源專案 oh-my-cli,通過 Issue 記錄任務狀態、自動測試提供反饋、失敗退回修改形成閉環。大模型從業者王楠將長週期任務難點概括為遠距離規劃、狀態追蹤、錯誤恢復。他指出,業界目前主要靠任務規劃、結構化記憶、多 Agent 協作等工程手段解決長週期任務難題,而非單靠模型自身能力。

王楠進一步指出,16 天連續執行不足以證明長週期能力成熟,關鍵驗證指標包括目標一致性、錯誤發現與恢復能力、人工接管頻次及 Token 與算力成本。他提到,真正需要驗證的是模型能否長期保持目標一致,還要考察最終功能是否可用、重複執行是否穩定、中途需要多少次人工接管,以及完成任務所需的 Token 和算力成本。這個觀點點出了目前業界評估長週期任務能力時的標準分歧,也暗示 Qwen3.8-Max 在工程化落地方面仍面臨挑戰。

開發者實測揭示了哪些真實痛點?

開發者艾林測試後認為,Qwen3.8-Max 在任務拆解、Agent 呼叫、需求理解和 UI 設計方面均有明顯提升,不過與 Fable 系列仍有距離。他指出,上代 Qwen3.7-Max 在處理複雜程式碼時前期看似順利,檢查結果時卻會出現漏洞,反而增加工作量;還會擴大修改範圍、改動無關配置,或者沒有嚴格遵守需求。

獨立開發者李預設為 Qwen3.8-Max 已經摸到了第一梯隊的門檻,但在生成互動網站時,模型沒有完整實現核心拖曳功能,還把 HTML 標籤直接顯示在頁面上。李默形容 Qwen3.8-Max 「有點懶」,需要把要求拆得非常具體,才能執行到位,沒有完全解決穩定性和交付意識的問題。這些實測反饋表明,儘管模型在基準測試中表現亮眼,但在實際開發場景中,其執行精度與自主性仍有待提升。

阿里的勝算究竟在哪裡?

Qwen3.8-Max API 定價為每百萬 Token 輸入 12 元、輸出 36 元,在國產頭部模型中處於中間價位。阿里還計劃開源 Qwen3.8 系列的 27B 小尺寸模型,為本地部署和低成本應用提供更多選擇。此前,阿里於 2026 年 6 月 2 日發表 Qwen3.7-Plus,在 Vision Arena 全球排名前五、中國第一,首次把視覺理解、深度推理、自我程式設計、工具呼叫與自驗證迭代放進同一個 Agent 工作流並開放 API。

這種多模態閉環 Agent 工作流的開放,為開發者提供了更完整的工具鏈支援。結合 Qwen3.8-Max 在科研程式設計與長週期任務上的提升,阿里試圖通過「高效能閉源模型 + 開源小模型 + 完整 Agent 工作流」的組合拳,在激烈的市場競爭中佔據有利位置。然而,面對即將發表的 Kimi K3 和 DeepSeek V4,阿里能否靠這個策略穩住陣腳,還要看市場反應。目前看來,模型能力的提升只是第一步,如何在實際應用中降低使用門檻、提高交付穩定性,才是決定勝負的關鍵。

繼續閱讀