OpenSquilla 0.5.0 是什麼?多模型集成如何用國產模型反超 Fable 5
2026 年 7 月 6 日,OpenSquilla 0.5.0 Preview 在 DRACO 深度研究榜 Brave Search 組拿下平均 64.09 分,高於 Opus 4.8(59.11)與 GPT-5.5(53.28),任務平均成本僅 $0.12,分別約為兩者的 8% 與 14%。
目錄

重點摘要
- 2026 年 7 月 6 日,OpenSquilla 0.5.0 Preview 在 DRACO 深度研究榜 Brave Search 組拿下平均 64.09 分,高於 Opus 4.8(59.11)與 GPT-5.5(53.28),任務平均成本僅 $0.12,分別約為兩者的 8% 與 14%。
- DuckDuckGo 組,OpenSquilla 以 60.85 分小幅領先 Anthropic 最新旗艦 Fable 5(59.80),成本 $0.39 對 Fable 5 的 $1.21,約後者的三分之一。
- 整套方案的陣容是 DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen3.7 四個國產模型,沒有任何海外旗艦,核心機制是 harness 層的並行提案加共識聚合。
2026 年 7 月 6 日,開源 AI agent 框架 OpenSquilla 發布 0.5.0 Preview 1,核心更新是在 harness 層把四個國產模型(DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen 3.7)組成並行提案的協作隊伍,再由一個模型做共識聚合、輸出最終答案。同步公布的 DRACO 深度研究榜結果顯示,這套純國產模型組合在 Brave Search 組與 DuckDuckGo 組均列第一,且兩組的任務成本都大幅低於對照的海外旗艦單跑方案。背後開發商是定位 harness 與模型優化雙線並行的基元律動(TokenRhythm),據公開報道,公司成立不久就完成首輪融資,估值達 1 億美元。
harness 層的並行提案,是怎麼跑的?
傳統 agent 框架通常選一個模型、跑一條路徑。OpenSquilla 0.5.0 的做法不同:讓多個模型在 harness 層各自完成搜尋與推理,彼此不共享中間狀態,最後才由聚合模型整合所有輸出。這就是「多樣性採樣加共識聚合」的實際做法。
這套設計主要是為了解決單一模型在深度研究任務中的硬傷:漏掉資訊來源、算錯數字,或在多重限制下顧此失彼。多個模型同時跑、互相補位,理論上能把這些缺口收窄。OpenSquilla 團隊同步發布的技術報告《Agentic Routing》進一步說明,這套 harness 原生路由還能把日常 agent 流量轉成自我進化的訓練資料,長期來看,系統會隨著使用量增加而越用越聰明。
一個沒有答案的細節:四個模型並行完成提案後,還要一個模型做整合輸出,但報告沒有說明聚合模型是哪一支。既然整套方案強調「沒有任何海外旗艦」,推測聚合層同樣用了國產模型,只是型號未公開。
DRACO 榜單的數字怎麼讀?
Brave Search 組的結果最直觀:OpenSquilla 平均 64.09 分,Opus 4.8 是 59.11,差了 8.42%,GPT-5.5 是 53.28,差了 20.27%。分差不是邊際調整。成本差更明顯,OpenSquilla 每次任務平均 $0.12,大約只有 Opus 4.8 成本的 8%、GPT-5.5 的 14%。這是同一組裡唯一同時帶走「最高分」與「最低成本」兩個標記的方案。
DuckDuckGo 組的對比換成 Fable 5:OpenSquilla 60.85,Fable 5 是 59.80,分數確實接近,DRACO 榜單的描述是「基本持平」。但成本是 $0.39 對 $1.21,差了三倍以上。Fable 5 在 Brave Search 組的成績還在跑,跨組比較目前無法完成。
讀這些數字之前有兩個限制必須說清楚。第一,DRACO 分數由 LLM 評判,存在評判偏差的問題,屬於階段性結果而非最終定論。第二,這份資料來自 OpenSquilla 團隊,是自述成績,目前尚無第三方獨立複現的報告。這不代表數據注水,但在做架構決策前,最好把這兩點納入評估。
對做 agentic 系統的工程師,這個結果指向什麼?
OpenSquilla 的版本演進給了一條清楚的脈絡:v0.1.0 做智慧路由(依任務難度自動選模型)、v0.2.0 做遷移工具讓其他 agent 框架的使用者低成本切換、v0.3.0 推 MetaSkill 自組織技能協議讓 agent 能自組工作流、v0.4.0 加可驗證編碼(以紅綠測試為交付依據)與第一個簽名桌面版、到 0.5.0 做多模型並行。五個版本,每次都在 harness 那層加功能,沒有換過底層模型。
從這個軌跡看,DRACO 榜單成績強化了一個正在成形的判斷:國產基礎模型單獨拿出來跟海外旗艦比,目前確實仍有差距;但在 harness 層組織得當的前提下,混用國產模型已可以在真實任務上跑出可比甚至更高的分數,且成本只要零頭。差異不在模型本身強多少,而在多個答案怎麼被組合成一個更好的答案。
對工程師而言,這條路的實務含義值得驗算,但也有明確的限制。並行跑多個模型意味著多倍的推論呼叫,延遲比單模型高,對需要快速回應的互動型場景未必合適。DRACO 評的是深度研究類任務,這類任務本來就允許較長的處理時間,榜單成績無法直接平移到其他任務類型。如果你的系統瓶頸是答案品質而非延遲、任務偏向多步驟資訊整合,這個方向值得實驗;但具體的 API 穩定性、速率限制與合規需求,brief 裡沒有資料,留待工程師自己評估。
OpenSquilla 能否在 DRACO 以外的任務類型上複現這次成績,現在還是問題。但這次結果至少說明了一件事:在 harness 層認真做工程的發揮空間,比直覺以為「只能換更強模型」要大得多。陣容裡四個模型沒有一個是海外旗艦,卻在深度研究榜拿下雙組第一,這件事本身就是值得拿去驗算的工程假設,而不只是一個行銷數字。
標籤


