Uni-ViGU:基于扩散视频生成器的统一视频生成与理解
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
整合视觉理解与生成的统一多模态模型面临一个根本性挑战:视觉生成的计算成本远高于理解,尤其是对于视频而言。这种不平衡促使我们反转传统范式:我们不是扩展以理解为中心的MLLM以支持生成,而是提出Uni-ViGU,一个通过扩展视频生成器作为基础来统一视频生成与理解的框架。我们引入了一种统一的流方法,在单一过程中对视频执行连续流匹配,对文本执行离散流匹配,从而实现连贯的多模态生成。我们进一步提出了一种基于模态驱动的MoE框架,该框架通过轻量级层增强Transformer块以进行文本生成,同时保留生成先验。为了将生成知识重新用于理解,我们设计了一种包含两个阶段的双向训练机制:知识召回阶段重建输入提示以利用学到的文本-视频对应关系,而能力精炼阶段则基于详细描述进行微调以建立判别性的共享表示。实验表明,Uni-ViGU在视频生成和理解上均取得了有竞争力的性能,验证了以生成为中心的架构是迈向统一多模态智能的可扩展路径。项目页面和代码:https://fr0zencrane.github.io/uni-vigu-page/。
引用
@article{arxiv.2604.08121,
title = {Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator},
author = {Luozheng Qin and Jia Gong and Qian Qiao and Tianjiao Li and Li Xu and Haoyu Pan and Chao Qu and Zhiyu Tan and Hao Li},
journal= {arXiv preprint arXiv:2604.08121},
year = {2026}
}
备注
Page and Code: https://fr0zencrane.github.io/uni-vigu-page/