LoomVideo 5B 對決 13B+ 主流框架,零開銷條件注入打破影片編輯序列翻倍死結
統一影片生成與編輯框架長期被一個計算瓶頸卡住:把來源影片 token 直接拼接進序列後,序列長度翻倍,self-attention 複雜度四倍暴增,讓實際部署成本高到難以接受。
統一影片生成與編輯框架長期被一個計算瓶頸卡住:把來源影片 token 直接拼接進序列後,序列長度翻倍,self-attention 複雜度四倍暴增,讓實際部署成本高到難以接受。LoomVideo 提出一套 5B 參數的統一架構,對比主流做法慣用的 13B 以上參數規模,宣稱在不拉長序列的前提下同時處理影片生成與編輯任務。
架構設計有兩個關鍵動作:一,以 MLLM(多模態大型語言模型)取代標準文字編碼器,再透過 Deepstack 注入機制將 MLLM 多層特徵對齊至擴散 Transformer(DiT);二,引入 Scale-and-Add 條件注入,對 clean latent 直接縮放相加,不額外擴充序列長度,論文稱此設計為「零開銷」。
對在做影片生成產品的團隊,這份工作指出一個值得關注的方向:編輯能力不必非得靠拼接序列換來。主流「13B+ 拼接」路線的計算代價限制了商業部署空間,LoomVideo 的做法理論上意味著以架構設計壓縮計算成本,而非靠堆參數換性能邊界。需注意的是,上述宣稱來自單一 HF 論文,尚未經獨立實測驗證,後續同行審閱結果仍是關鍵變數。


