News
Loading market feed...
News 快訊

把模型自己的失敗當訓練資料:DPO 不只是對齊工具

大多數人對 DPO 的印象停留在 RLHF 的替代品,用人類偏好資料讓聊天機器人更安全、更有禮貌。

DeltaMedia 編輯部 2 min 2026年6月3日
把模型自己的失敗當訓練資料:DPO 不只是對齊工具

把模型自己的失敗當訓練資料:DPO 不只是對齊工具

大多數人對 DPO 的印象停留在 RLHF 的替代品,用人類偏好資料讓聊天機器人更安全、更有禮貌。DharmaOCR 提了一個不同的問題:如果任務本身就有客觀的對錯,DPO 能不能用來直接消除特定的失敗模式?

背景是這樣的:視覺語言模型在做 OCR 時有一種典型的退化(degeneration),模型進入重複迴圈,輸出無意義的重複文字,而不是實際轉錄。DharmaOCR 團隊在巴西葡萄牙語結構化文件的 benchmark 上測量了這個比率,開源模型家族的原始退化率從不到 1% 到超過 33% 都有。SFT 微調之後確實有改善,但很少能降到生產環境可接受的水準。問題的根源在結構上:SFT 優化的是「生成正確輸出的機率」,卻沒有明確懲罰退化這件事本身。這是天花板,不是調參能突破的瓶頸。

接著他們在 SFT 後加了第二段訓練:DPO。訓練對的構成方式很直接,同一批文件、同一個模型,把模型跑出來的正確轉錄標為 chosen,把退化迴圈的輸出標為 rejected。偏好訊號不需要人類標注,就藏在模型自己失敗的輸出裡。OCR 沒有主觀性,正確轉錄與退化迴圈的邊界是二元的、客觀的,這讓 preference pair 的構造幾乎是自動化的。

結果是:在每一個測試的模型家族,退化率都下降了,沒有例外。平均降幅 59.4%,最佳案例達 87.6%(Nanonets-OCR2–3B 從 1.61% 降到 0.20%)。方向不變,只有幅度因模型而異。

這裡有一個值得多想一層的技術意涵:DPO 的 contrastive 結構同時拉高 chosen 機率、壓低 rejected 機率。對有明確失敗模式的任務來說,這比 SFT 的單向優化更精準。SFT 知道什麼是對的,但不顯式知道什麼是特別需要避免的;DPO 把這兩件事同時處理。

對做垂直任務微調的工程師,這是一把具體的尺:問自己,這個任務的失敗有沒有客觀的偏好訊號?OCR 的退化、程式碼生成的編譯失敗、結構化輸出的格式錯誤,只要失敗可以被定義,模型自己跑出來的錯誤輸出就已經是 DPO 的訓練資料了。不需要人工標注偏好,不需要聊天情境。SFT 之後的第二段 DPO,是被低估的選項,值得列入每一個垂直微調專案的標準工序。

繼續閱讀