Tele-Omni:用于视频生成与编辑的统一多模态框架
计算机视觉与模式识别
2026-02-24 v2
摘要
近期的扩散模型视频生成技术显著提升了视觉保真度和时序一致性。然而,大多数现有方法仍局限于特定任务,主要依赖文本指令,限制了其在统一框架下处理多模态输入、情境参考及多样化视频生成与编辑场景的能力。此外,许多视频编辑方法依赖针对单个操作的精心工程的管道,阻碍了可扩展性和可组合性。本文提出 Tele-Omni,一个支持文本、图像和参考视频等多模态指令的统一视频生成与编辑框架。Tele-Omni 利用预训练的多模态大语言模型解析异构指令,推断结构化的生成或编辑意图,同时扩散生成器在这些结构化信号条件下完成高质量视频合成。为实现跨异构视频任务的联合训练,我们引入任务感知的数据处理管道,将多模态输入统一为结构化指令格式,同时保留任务特定约束。Tele-Omni 支持广泛的 video-centric 任务,包括文本到视频生成、图像到视频生成、首尾帧视频生成、情境视频生成和情境视频编辑。通过解耦指令解析与视频合成,并结合任务感知数据设计,Tele-Omni 实现了灵活的多模态控制,同时保持强大的时序一致性和视觉一致性。实验结果表明,Tele-Omni 在多个任务上实现了竞争性能。
引用
@article{arxiv.2602.09609,
title = {Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing},
author = {Jialun Liu and Tian Li and Xiao Cao and Yukuo Ma and Gonghu Shang and Haibin Huang and Chi Zhang and Xiangzhen Chang and Zhiyong Huang and Jiakui Hu and Zuoxin Li and Yuanzhi Liang and Cong Liu and Junqi Liu and Robby T. Tan and Haitong Tang and Qizhen Weng and Yifan Xu and Liying Yang and Xiaoyan Yang and Peng Yu and Shiwen Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2602.09609},
year = {2026}
}