News 快訊
VSTAT 基準測試揭穿影片理解幻覺,SOTA 模型僅略勝矇答基線
一份新基準讓多模態大語言模型(MLLM)的影片理解成績大幅縮水。
DeltaMedia 編輯部 1 min 2026年6月3日
一份新基準讓多模態大語言模型(MLLM)的影片理解成績大幅縮水。VSTAT 以 834 段影片配上 1500 道刻意設計的問題,這些題目單憑任何一幀或短片段都無法作答,必須跨整段影片持續追蹤實體與狀態演變。測試結果:現有 SOTA 模型得分遠低於人類,且僅略高於不看影片、只靠統計分布猜答案的「答案先驗」基線。
VSTAT 的 834 段素材同時涵蓋合成影片與真實世界影片,確保場景多元。1500 題的核心設計邏輯是封堵捷徑:單幀辨識在此必然失分。研究團隊更將模型的思維鏈(thinking trace)與影片時間流逐段比對,精確定位失敗時點與失敗原因,而非僅公布最終分數,這讓診斷從「模型差」落地到「在第幾秒、因為什麼而出錯」。
VSTAT 的殺傷力在於它揭示一個結構性漏洞:現有影片 benchmark 的高分,可能大量來自單幀辨識捷徑,而非真正的連續時間理解。對正在做多模態影片產品的團隊,這是一把直接的診斷尺,你的模型可能能描述畫面,卻記不住實體在整段影片裡的狀態變化。會看,不會記帳。


