News
Loading market feed...
News 快訊

Anthropic 研究:為什麼 Claude 的行為會因模型與語言而不同?

Anthropic 分析 309,815 段真實對話後發現,Sonnet 4.6、Opus 4.7、Opus 4.6 三個模型版本的溝通風格明顯不同:Sonnet 4.6 最暖且回應最短,Opus 4.7 最坦率謹慎,Opus 4.6 最傾向直入重點。

DeltaMedia 編輯部 6 min 2026年7月14日
Anthropic 研究:為什麼 Claude 的行為會因模型與語言而不同?
目錄

Anthropic 研究:為什麼 Claude 的行為會因模型與語言而不同?

重點摘要

  • Anthropic 分析 309,815 段真實對話後發現,Sonnet 4.6、Opus 4.7、Opus 4.6 三個模型版本的溝通風格明顯不同:Sonnet 4.6 最暖且回應最短,Opus 4.7 最坦率謹慎,Opus 4.6 最傾向直入重點。
  • 使用者說的語言也在影響 Claude 的態度:印地語與阿拉伯語對話中 Claude 最暖,英語與俄語對話中最嚴謹,荷蘭語對話中 Claude 最常主動承認自己出錯。
  • Anthropic 在 2026 年 7 月 13 日公布這份研究,並坦承「我們還不知道為何如此,也不確定這是否是我們想要的」。

2026 年 7 月 13 日,Anthropic 公布一份針對 309,815 段真實使用者對話的行為研究,發現一件讓人不安的事:Claude 在不同模型版本與語言之間的行為模式有系統性落差,而 Anthropic 坦承這些落差「並非刻意設計出來的」。換句話說,這個模型在你手上展現的個性,有一部分不是任何人選擇的結果。

Anthropic 最新研究揭示,Claude 的溝通風格會隨模型版本與對話語言產生非預期的系統性偏移,這意味著 AI 的「個性」並非完全可控,對追求品牌一致性的開發者帶來了全新的工程挑戰。

Sonnet 4.6、Opus 4.7、Opus 4.6 的行為差距從哪裡來?

三個版本擺在一起,行為側寫差距清楚。Sonnet 4.6 的回應較暖、篇幅偏短;Opus 4.7 更直接表態、且更謹慎地標記自身的不確定性;Opus 4.6 最不繞路,習慣省略鋪陳直接給答案。這三種差異無關能力高低,而是同一套訓練目標下跑出的不同「個性偏移」。

問題在於成因。理論上,每一代模型的訓練資料組成、人類偏好標注的風格指引、以及評分者群體的構成都略有不同,這些上游差異在多輪強化學習後,可能以溝通風格的形式在下游放大。但研究本身沒確認這條傳遞路徑,Anthropic 只是陳述觀察到的結果。

對產品端的衝擊是具體的。如果你的代理人工作流從 Opus 4.6 升版到 Opus 4.7,改變的不只是模型能力,還有整個對話基調。Opus 4.7 更頻繁標記不確定性,代表它更常說「我不確定」;在需要代理人做出決策的場景,這種傾向可能變成更頻繁地暫停、要求確認,直接影響自動化工作流的完成率,而這種差異在只跑能力評估的基準測試框架裡根本看不出來。

使用者說的語言,怎麼改變 Claude 的態度?

語言維度的發現更出乎意料。在 309,815 段對話的樣本裡,印地語與阿拉伯語互動中 Claude 最暖;英語與俄語對話中 Claude 最嚴謹;荷蘭語對話裡 Claude 最常主動承認自己的錯誤。三個語言維度的差異方向各不相同,不是簡單的「熱情」或「嚴謹」單一軸線的縮放。

這些差異的機制,研究沒有給定論。一個可能的方向:不同語言的訓練語料在「語域」上分佈不均,部分語言的語料偏學術正式,另一些偏日常口語,模型生成時跟著語域走,在態度上就出現了落差。但這只是方向性推測,不是已驗證的解釋。

對跨語言產品的工程師來說,這個發現最直接的意義是:用英語做完評估、就假設其他語言行為等比例縮放,這個假設現在有了資料層面的反例。一個在英語環境下嚴謹的 Claude,切到印地語使用者時語氣基調可能明顯不同。在客服、法律、金融這些需要統一品牌聲音的場景,這種漂移不是邊際誤差,而是會直接被使用者感知的品質落差。

Anthropic 連原因都說不清楚,這代表什麼?

比起數字本身,這份研究更關鍵的在於 Anthropic 選擇怎麼說這件事。研究裡明確寫道:團隊還不了解這些差異為何存在,也不確定這是否符合他們的預期目標。

AI 實驗室通常把行為差異包裝成「設計特性」,很少正面承認訓練結果偏離預期。Anthropic 這次公開存疑固然誠實,但也直接點出一個比風格差異更根本的問題:如果模型開發方無法預測「個性」是怎麼浮現的,外部開發者就更難把這件事當成可工程化的控制點處理。

更棘手的是,這類不確定性跟模型能力的不確定性,本質上不太一樣。能力不足可以換模型、加上檢索增強生成、多試幾次。但個性不穩定,你很難在事後察覺,使用者的第一印象卻早已定型了。即使你在系統提示詞裡加了語氣指令,底層的「個性偏移」是否真的被覆蓋,目前也沒有可靠的驗證方法。

這對代理人產品開發者,是哪類工程問題?

大多數開發者在選模型時測的是準確率、延遲、成本,很少把「風格一致性」獨立列為評估維度。這份研究提供了一個理由把它加進測試矩陣。

具體的做法並不複雜:把模型版本與主要服務語言都視為需要固定的變數,在 A/B 測試框架裡做受控對比,而不是假設同一個 API 背後行為均一。如果產品服務多個語言市場,每個語言都要有各自的基準評估,英語的測試結果不能直接套用到印地語或荷蘭語的使用場景。對需要一致品牌聲音的代理人產品,這些測試不是「錦上添花」的優化,而是上線前應該做的基本風險確認。

當然,這份研究的資料來源是 Anthropic 自報,成因目前尚無定論;309,815 段對話的樣本規模夠大,但差異背後的機制仍屬開放問題,後續訓練是否能修正、修正後是否會引入其他偏移,都還沒有答案。

Claude 的個性,看起來更像是訓練過程中意外浮現的湧現屬性,而非刻意工程出來的特質。對建構者來說,這不是要停止使用 Claude 的理由,但確實是一個提醒:當你把模型當 API 元件組進產品,行為一致性不是預設保證。你選哪個版本、你的使用者說哪種語言,都在悄悄決定他們最後拿到的是哪一個 Claude。

標籤

#claude 行為差異 #anthropic 研究 #sonnet opus 差異 #claude 模型比較 #ai 模型一致性

繼續閱讀