OmniCamera:用于任意相机控制的多任务视频生成的统一框架
计算机视觉与模式识别
2026-04-08 v1
摘要
视频从根本上交织着两个关键轴:场景的动态内容和观察它的相机运动。然而,现有的生成模型经常将这两个因素纠缠在一起,限制了独立控制。在这项工作中,我们引入了 OmniCamera,一个旨在明确解耦并控制这两个维度的统一框架。这种组合方法通过允许相机和内容条件的任意配对,实现了灵活的视频生成,解锁了前所未有的创作控制。为了克服此类系统中固有的模态冲突和数据稀缺这两个基本挑战,我们提出了两项关键创新。首先,我们构建了 OmniCAM,一个将精心策划的真实视频与合成数据相结合的新型混合数据集,为鲁棒的多任务学习提供了多样化的配对示例。其次,我们提出了一种双层次课程协同训练策略,以减轻模态干扰并从多样化数据源中协同学习。该策略在两个层次上运作:第一,它按难度逐步引入控制模态(条件层);第二,在适应真实数据以实现照片级真实感之前,在合成数据上训练精确控制(数据层)。因此,OmniCamera 实现了最先进的性能,在保持优越视觉质量的同时,为复杂相机运动提供了灵活控制。
引用
@article{arxiv.2604.06010,
title = {OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control},
author = {Yukun Wang and Ruihuang Li and Jiale Tao and Shiyuan Yang and Liyi Chen and Zhantao Yang and Handz and Yulan Guo and Shuai Shao and Qinglin Lu},
journal= {arXiv preprint arXiv:2604.06010},
year = {2026}
}