News
Loading market feed...
News 快訊

DeepSeek 發表 V4-Flash-Vision 實驗模型,多模態 Agent 效能直逼 Opus-4.8

DeepSeek 於 2026 年 8 月 21 日正式在 API 平台推出 DeepSeek-V4-Flash-Vision-Exp 實驗性多模態模型,文字推理與 Agent 能力與既有 V4-Flash 持平,並同步發布 DeepSeek Harness 0.1.1 以支援新模型。

DeltaMedia 編輯部 8 min 2026年8月21日
DeepSeek 發表 V4-Flash-Vision 實驗模型,多模態 Agent 效能直逼 Opus-4.8
目錄

DeepSeek 發表 V4-Flash-Vision 實驗模型,多模態 Agent 效能直逼 Opus-4.8

重點摘要

  • DeepSeek 於 2026 年 8 月 21 日正式在 API 平台推出 DeepSeek-V4-Flash-Vision-Exp 實驗性多模態模型,文字推理與 Agent 能力與既有 V4-Flash 持平,並同步發布 DeepSeek Harness 0.1.1 以支援新模型。
  • 該模型在 Terminal Bench 2.1 等基準測試中表現亮眼,官方宣稱其多模態 Agent 效能已接近 Anthropic 的 Opus-4.8,試圖在成本與效能間取得平衡。
  • 市場現況顯示,開發者已習慣將 Opus-4.8 用於規劃、DeepSeek 用於執行的分工架構以降低成本;V4-Flash-Vision-Exp 的出現可能進一步壓縮這種混合架構的成本空間,並與阿里 Qwen3.7-Plus 等競爭對手展開多模態閉環工作流的競爭。

2026 年 8 月 21 日,DeepSeek AI 在 X 平台宣佈,實驗性多模態模型 DeepSeek-V4-Flash-Vision-Exp 正式在 DeepSeek API Platform 上線。這款模型不僅保留了 DeepSeek-V4-Flash 在文書處理、推理與世界知識的全部能力,在多模態 Agent 基準測試的表現也明顯大躍進。DeepSeek 官方直言,該模型的多模態 Agent 效能已接近 Anthropic 的 Opus-4.8。與此同時,DeepSeek 也同步發布了 DeepSeek Harness 0.1.1 版本,為新模型提供開箱即用的支援。這一步讓 DeepSeek 推進了多模態 Agent 的佈局,也給開發者更實惠的選擇。

DeepSeek 推出實驗性多模態模型 V4-Flash-Vision-Exp,以逼近頂級模型 Opus-4.8 的 Agent 效能與高性價比定位,直接衝擊現行的「規劃與執行分流」混合架構,並與阿里的閉環生態展開路線之爭。

多模態 Agent 效能能否真正挑戰 Opus-4.8 的基準地位?

DeepSeek 在這則公告中強調,V4-Flash-Vision-Exp 在文字能力上與現有的 DeepSeek-V4-Flash 完全一致,涵蓋了 Agent 操作、邏輯推理以及世界知識。然而,真正的突破點在於多模態領域。官方表示,V4-Flash-Vision-Exp 相較於 V4-Flash 實現了巨大的效能跨越,並使其多模態 Agent 能力接近 Opus-4.8。這意味著開發者現在可以透過 `deepseek-v4-flash-vision-exp` 這個模型識別碼,在 DeepSeek API 上直接呼叫具備視覺理解與複雜任務執行能力的模型。

從基準測試數據來看,V4-Flash-Vision-Exp 在多個關鍵指標上極具競爭力。根據 DeepSeek API 文件更新記錄,該模型在 Terminal Bench 2.1 上獲得 83.9 分,在 DeepSWE 上獲得 59.3 分,在 DSBench-Hard 上獲得 63.6 分。這些數據直接呈現了模型在終端操作、軟體工程任務,以及高難度資料科學基準測試的實力。此外,在 NL2Repo 上獲得 57.7 分,在 AutomationBench(Public)上獲得 25.7 分,在 ApexBench(Pass@1)上獲得 36.5 分,在 Agents' Last Exam 上獲得 27.3 分,在 Chartography 上獲得 64.3 分,以及在 ZeroBench(Pass@5)上獲得 35.0 分。這些廣泛的基準測試覆蓋面,顯示 DeepSeek 試圖證明其模型在多種複雜 Agent 場景下的通用性與可靠性。

然而,將「接近 Opus-4.8」作為宣傳點,也引發了市場對於基準定義的討論。Opus-4.8 自 2026 年 6 月起,已被業界廣泛視為 Agent 規劃能力的基準天花板。許多開源 Agent Swarm 框架已經採用 Opus-4.8 進行高層規劃,並搭配 DeepSeek 模型進行具體執行,這種混合架構在保持同等品質的同時,將成本降低了十倍,且速度提升兩倍。V4-Flash-Vision-Exp 的出現,是否意味著單一模型就能顛覆這種「規劃與執行分流」的混合架構?還是說,它只是提供了另一種低成本執行選項,讓開發者能更細緻地優化成本結構?這取決於模型在實際複雜工作流中的穩定性,而非單純的基準測試分數。

開發者工具鏈 DeepSeek Harness 0.1.1 如何降低整合門檻?

除了模型本身,DeepSeek 在 8 月 21 日同步發布的 DeepSeek Harness 0.1.1 也是焦點。這個工具鏈的更新,直接針對新上線的 V4-Flash-Vision-Exp 提供了開箱即用的支援。對於工程師而言,這意味著無需進行繁瑣的程式碼調整或環境配置,即可將新的多模態能力整合到現有的 Agent 應用程式中。DeepSeek Harness 的迭代速度,看得出 DeepSeek 非常重視開發者體驗,也想用完整的工具生態系來拉高新模型的採用率。

這種「模型 + 工具鏈」同步發布的策略,在 AI 業界並非罕見,但 DeepSeek 的執行節奏顯得格外緊湊。從模型上線到工具支援,僅在一天內完成,這對於需要快速驗證想法的創業者與工程師來說,是一個重要的訊號。這代表 DeepSeek 不只看重模型本身的技術指標,更在乎技術如何落實到實際應用。對於那些正在構建多模態 Agent 的團隊,DeepSeek Harness 0.1.1 可能成為降低試錯成本、加速產品迭代的重要助力。

然而,工具鏈的便利性也帶來了依賴風險。開發者如果過度依賴特定廠商的工具鏈,可能會面臨供應商鎖定(Vendor Lock-in)的風險。如果 DeepSeek 未來調整 API 結構或定價策略,基於 DeepSeek Harness 構建的應用可能需要進行大規模重構。因此,儘管 0.1.1 版本提供了便捷的整合體驗,開發者仍需在便利性與架構靈活性之間取得平衡。這也提醒開發者,評估新模型時除了看效能與成本,還得考量工具鏈的開放性與長期維護成本。

市場競爭格局:從分工架構到多模態閉環的演進

V4-Flash-Vision-Exp 的發布,置於 2026 年下半年的多模態 Agent API 競爭背景下,顯得尤為關鍵。在此之前,市場已形成一種隱性的分工共識:使用 Opus-4.8 處理高階規劃與複雜推理,使用 DeepSeek 等低成本模型處理具體執行任務。這種架構在 2026 年 6 月的 iSing Research 報告中已被證實能有效降低十倍成本。然而,隨著 V4-Flash-Vision-Exp 宣稱其多模態能力接近 Opus-4.8,這種分工架構的合理性受到了挑戰。如果單一模型就能同時滿足規劃與執行的需求,開發者是否還有必要維持複雜的混合架構?

另一方面,競爭對手並未坐視。阿里巴巴的 Qwen3.7-Plus 在 2026 年 6 月也進入了視野,該模型將視覺理解、深度推理、自我程式設計、工具呼叫與自我驗證整合在單一 Agent 迴圈中,並開放 API。Qwen3.7-Plus 的策略是打造一個「多模態閉環」的工作流,強調在單一模型內完成從感知到行動的完整過程。這與 DeepSeek 目前仍依賴外部工具鏈(如 Harness)來輔助 Agent 執行的模式形成對比。Qwen3.7-Plus 的出現,代表了另一種技術路線:將更多能力內建於模型本身,而非依賴外部框架。

這兩種路線的競爭,說穿了就是雙方對「Agent 架構邊界」的想法不同。DeepSeek 透過強大的基準測試表現與完善的工具鏈支援,試圖證明其模型在開放生態中的適應性;而 Qwen3.7-Plus 則透過內建的多模態閉環,試圖提供更簡潔、更自包含的解決方案。對於開發者而言,選擇哪種路線,取決於其應用場景的複雜度與對可控性的需求。如果應用需要高度的客製化與靈活性,DeepSeek 的開放生態可能更具吸引力;如果應用追求快速部署與低維護成本,Qwen3.7-Plus 的閉環設計可能更勝一籌。

實驗性標籤背後的風險與機會

值得注意的是,DeepSeek 將 V4-Flash-Vision-Exp 標記為「實驗性」(Experimental)。這意味著該模型可能尚未經過全面的生產環境驗證,其穩定性與一致性可能仍存在未知風險。對於追求極高可靠性的企業級應用來說,這可能是一個阻礙。然而,對於願意承擔風險以換取早期技術紅利的創業者與工程師來說,這卻是一個難得的機會。實驗性標籤往往伴隨著更低的定價或更靈活的 API 政策,這使得開發者能夠以較低的成本進行大規模測試與迭代。

此外,實驗性模型也為社群回饋提供了空間。DeepSeek 透過公開 API 與基準測試數據,邀請開發者實際測試並提供回饋,這有助於模型在短時間內快速最佳化。這種「邊用邊改」的開發模式,在開源社群中極為常見,但在商業 API 領域則相對罕見。DeepSeek 選擇這種模式,顯示其對於社群驅動開發的認同,也暗示其希望透過廣泛的實際應用場景,來打磨模型的真實世界表現。

然而,實驗性標籤也帶來了不確定性。模型可能會在未來版本中進行重大調整,甚至可能因為穩定性問題而下線。因此,開發者在採用 V4-Flash-Vision-Exp 時,必須建立完善的回退機制與監控體系,以應對可能的服務中斷或效能波動。這也提醒我們,在追求技術前沿的同時,必須保持對風險的清醒認知。

整體來看,DeepSeek-V4-Flash-Vision-Exp 的發布不只是 DeepSeek 展示技術,也直接挑戰了現有的多模態 Agent 架構。它試圖透過接近 Opus-4.8 的效能與更具成本效益的定位,重新定義開發者對於多模態 Agent 的期望。然而,實驗性標籤與競爭對手的強勢表現,也為其未來發展帶來了不確定性。對於技術背景的創業者與工程師來說,這是一個值得密切關注的變數,也是一個值得深入測試的機會。

繼續閱讀