AI 寫程式如何自我驗證?OpenSquilla 0.4.0 紅綠回歸證據鏈解析
7 月 1 日,開源 AI Agent 專案 OpenSquilla 發布 0.

7 月 1 日,開源 AI Agent 專案 OpenSquilla 發布 0.4.0 版本,推出 coding 模式,直接將自我驗證機制鎖進 Agent 的交付流程。AI 改完程式碼後,須先自行跑出一條「紅→綠→回歸」的測試證據鏈,三關全過才允許回傳結果;任一關失敗,自動修復機制立即介入重改,不讓未驗證的輸出出門。同一版本也推出了 OpenSquilla 首個簽名並公證的桌面安裝程式,macOS 與 Windows 均可雙擊安裝,不需命令列。
「紅→綠→回歸」三關設計,讓每一步都能被稽核。AI 先寫一個注定失敗的測試,給 bug 定性,確認這個測試真的能抓住問題,而不只是形式上過關;修好功能後讓測試由紅轉綠;再跑一遍專案原有測試,確認改動沒有打壞其他部分,三關全過才算交付。所有改動都在隔離副本裡進行,驗收合格才落回源碼。官方示範選的是 micrograd,OpenAI 創始成員、2026 年 5 月加入 Anthropic 主導預訓練研究的 Andrej Karpathy 所寫的極簡自動微分庫:AI 為其新增計算梯度功能後,與 PyTorch 在同一題目上並排比對,前向值與每個梯度的精度達到小數點後 10 位完全吻合。梯度算錯的麻煩在於模型不報錯也不崩潰,只是越學越偏,肉眼幾乎察覺不到,讓這類 bug 極難靠人工複核收尾,也讓這個示範案例更具說服力。0.4.0 是 OpenSquilla 繼自家 coding 基準 claw-swe-bench 後,在 agent runtime 的最新實作。
AI 寫程式「能寫」卻「不能信」,卡住了 AI 編碼規模化導入生產環境的去路:多數 Agent 改完即交,工程主管仍須逐行複核才敢放行,根本無法做到無人值守。把驗證內建到 Agent 裡,理論上意味著驗收標準從「它說改好了」變成「它能拿出可被稽核的測試證據」;對工程團隊而言,這看起來是比提升能力更難、也更關鍵的轉變,畢竟要做到無人值守,前提是交付物可被複核,而不是只聽口頭宣稱。OpenSquilla 的主線定位是「提升單位成本 Agent 智能」,利用本地智能路由在調用前壓低成本:相比通用閘道 OpenRouter,路由精度高約 4.4 個百分點、成本低約 75%;跑同類任務相比旗艦模型,品質相當、成本相差約 9 倍。公司官網稱常規場景綜合降本 60–80%(以上數字均為廠商自報或轉述口徑,未經獨立實測)。基元律動創始人王雲鶴曾負責頭部科技公司大模型研發,CTO 為韓凱;OpenSquilla 上線數週內 GitHub star 增至數千量級,成立數月後完成首輪融資。
標籤


