Omni-Video: democratizing unified video understanding and generation
计算机视觉与模式识别
2026-03-16 v4
摘要
在统一理解和生成建模方面取得的显著突破推动了图像理解、推理、制作和编辑方面的显著进展,但当前的基础模型主要聚焦于图像处理,导致针对视频理解和生成的统一模型开发存在空白。本报告提出Omni-Video,一个高效且有效的统一框架,用于视频理解、生成以及基于指令的编辑。我们的关键思想是教授现有多模态大语言模型(MLLM)生成用于扩散解码器输入的连续视觉线索。为充分发挥系统在统一视频建模方面的潜力,我们整合了若干技术改进:1)一种轻量级架构设计,分别在MLLM顶部附加视觉头,在扩散解码器输入前附加适配器,前者产生用于后者的视觉标记,这些标记适配扩散解码器的条件空间;以及2)一种高效的多阶段训练方案,利用有限的数据和计算资源实现MLLM与扩散解码器之间的快速连接。我们通过实验表明,该模型在视频生成、编辑和理解任务中表现出令人满意的泛化能力。
引用
@article{arxiv.2507.06119,
title = {Omni-Video: Democratizing Unified Video Understanding and Generation},
author = {Zhiyu Tan and Hao Yang and Luozheng Qin and Jia Gong and Mengping Yang and Hao Li},
journal= {arXiv preprint arXiv:2507.06119},
year = {2026}
}
备注
Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/