News
Loading market feed...
News 快訊

港中大聯手華為重構語音輸入表徵,TextPro-SLM 在 3B/7B 兩尺度達目前最低 modality gap

香港中文大學與華為研究人員提出 TextPro-SLM,把縮小語音-文字模態差距的主戰場從輸出端移到輸入端。

DeltaMedia 編輯部 1 min 2026年6月8日
港中大聯手華為重構語音輸入表徵,TextPro-SLM 在 3B/7B 兩尺度達目前最低 modality gap

港中大聯手華為重構語音輸入表徵,TextPro-SLM 在 3B/7B 兩尺度達目前最低 modality gap

香港中文大學與華為研究人員提出 TextPro-SLM,把縮小語音-文字模態差距的主戰場從輸出端移到輸入端。他們設計統一語音編碼器,同步抽取文字 tokens 與韻律嵌入(prosody embeddings),讓語音輸入在進語言模型之前就更接近文字表徵。成果:在 3B 與 7B 兩個模型尺度上達到目前最低 modality gap,全程訓練音頻僅需約 1,000 小時。

論文題為《Minimizing Modality Gap from the Input Side: Your Speech LLM can be a Prosody-Aware Text LLM》,由香港中文大學與華為合作發表。核心設計是讓統一編碼器同時輸出詞彙內容(text tokens)與韻律嵌入兩路訊號並行送進語言模型,有別於主流在輸出端掛語音解碼頭的慣常路線;副語言理解(paralinguistic understanding)任務上同樣展現強勁表現。

主流方案把語音-文字表徵差距留在模型核心,每次新語音任務都要額外適應。TextPro-SLM 的論點是:若輸入端就對齊文字空間,語言模型本體不需為語音再改動。這意味著「改輸入表徵」的路線理論上比「調輸出端」更省訓練資源、更快收斂。千小時量級的訓練需求若能廣泛複現,對做多模態的開發者而言是值得優先驗證的方向;但當前數字與宣稱僅來自論文摘要,尚待社群實測確認。

繼續閱讀