中文

OmniCam:通过相机控制实现统一多模态视频生成

计算机视觉与模式识别 2025-04-04 v1 人工智能

摘要

相机控制通过改变相机位置和姿态实现多样化的视觉效果,已引起广泛关注。然而,现有方法面临交互复杂和控制能力有限等挑战。为此,我们提出了 OmniCam,一个统一的多模态相机控制框架。利用大型语言模型和视频扩散模型,OmniCam 生成具有空间一致性和时间一致性的视频。它支持多种输入模态的组合:用户可以提供文本或视频作为相机路径指导,提供图像或视频作为内容参考,从而实现对相机运动的精确控制。为促进 OmniCam 的训练,我们引入了 OmniTr 数据集,其中包含大量高质量长序列轨迹、视频及相应描述。实验结果表明,我们的模型在各种指标上实现了在高质量相机控制视频生成方面的先进水平。

关键词

引用

@article{arxiv.2504.02312,
  title  = {OmniCam: Unified Multimodal Video Generation via Camera Control},
  author = {Xiaoda Yang and Jiayang Xu and Kaixuan Luan and Xinyu Zhan and Hongshun Qiu and Shijun Shi and Hao Li and Shuai Yang and Li Zhang and Checheng Yu and Cewu Lu and Lixin Yang},
  journal= {arXiv preprint arXiv:2504.02312},
  year   = {2025}
}