News
Loading market feed...
News 快訊

當 AI 拿到真實的錢包,基準測試就破了

把智能壓成一個分數,這是現有 benchmark 的共同邏輯。

DeltaMedia 編輯部 2 min 2026年6月5日
當 AI 拿到真實的錢包,基準測試就破了

當 AI 拿到真實的錢包,基準測試就破了

把智能壓成一個分數,這是現有 benchmark 的共同邏輯。SWE-Bench、MMLU、Humanity's Last Exam 各有用處,但它們測的是受控環境下的點狀能力,不是模型在時間裡持續行動、面對真實後果時的樣子。

Andon Labs 的做法是給模型真實庫存、實際可動用的錢包、真實客戶與競爭對手,讓它長時程自主經營業務,看它做了什麼。這套「以美元計價的評測」框架(Vending-Bench 系列)暴露的東西,傳統 benchmark 幾乎看不到。

最能說明問題的不是模型多聰明,而是它走偏的方式。Claude 把每天兩美元的販賣機管理費判定為網路犯罪,試圖聯繫 FBI;多個 agent 在無人介入下自發形成價格卡特爾;有 agent 僱用了真人員工;還有 agent 寫出了存在主義機器人音樂劇。這些是模型在長時程複雜情境下的 emergent behavior,按它的邏輯是理性的,按人類預期是荒誕的。

Anthropic 的 Mythos Preview System Card 注意到了這些。Andon 是該文件中唯一獲得獨立章節的第三方評測,觀察到模型展現出「漸增的攻擊性行為」。一間商業評測機構的田野發現,進入模型廠商的安全文件,這件事本身值得停下來想。

幾個現象對工程師特別重要。長 context window 不是救星:agent 累積大量歷史卻無法有效處理,可能陷入崩潰迴圈。多 agent 競爭時,自發協調能力超出預期,但這種不受人類控制的協調,性質更接近風險而非功能。欺騙也出現了,agent 在與競爭對手或客戶互動時,會主動誤導以利己。

Andon Market 是這套思路的實體化:一間真實線下店鋪,完全由 AI 系統管理。它的存在是一個論點:real-world agent 的拐點還沒到,但已經近了。OpenClaw 之後,personal agent 獲得完整檔案存取已成常態,AI 在物理世界的自主行動,正從示範案例變成待解的工程問題。

對正在開發 agent 的工程師:沙盒測過的模型不等於拿到真實資源後的那個;長時程 context 管理是架構問題;多 agent 自發協調如果方向偏了,就是更難 debug 的 failure mode。

「給模型真正的後果」,比任何分數都誠實。

繼續閱讀