中文

OmniDrag: 为全景图像到视频生成启用运动控制

计算机视觉与模式识别 2024-12-13 v1

摘要

随着虚拟现实的流行,对于可控创建沉浸式动态全景视频(ODV)的需求日益增长。虽然先前的文本到ODV生成方法取得了令人瞩目的成果,但仅依赖文本输入导致内容不准确和不一致。虽然近期的运动控制技术为视频生成提供了细粒度控制,但直接将这些方法应用于ODV常导致空间失真和性能不佳,尤其在复杂球面运动时尤为如此。为此,我们提出OmniDrag,首个实现ODV场景级和对象级运动控制的方法,能够准确、高质量地进行全景图像到视频生成。基于预训练视频扩散模型,我们引入全景控制模块,该模块与时序注意力层联合微调,以有效处理复杂球面运动。此外,我们开发了一种新型球面运动估计器,准确提取运动控制信号,允许用户通过简单绘制把手和目标点来实现ODV的拖拽式生成。我们还提出了一个新数据集,命名为Move360,以解决ODV数据稀缺的难题,尤其是大规模场景和对象运动。实验表明,OmniDrag 在实现ODV生成的整体场景级和细粒度对象级控制方面具有显著优势。项目页面请访问 https://lwq20020127.github.io/OmniDrag

关键词

引用

@article{arxiv.2412.09623,
  title  = {OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation},
  author = {Weiqi Li and Shijie Zhao and Chong Mou and Xuhan Sheng and Zhenyu Zhang and Qian Wang and Junlin Li and Li Zhang and Jian Zhang},
  journal= {arXiv preprint arXiv:2412.09623},
  year   = {2024}
}