Cavia:具备视图集成注意力的数据驱动多视角视频扩散
计算机视觉与模式识别
2024-10-15 v1
摘要
近年来图像到视频生成取得了显著进展。然而,生成帧的3D一致性和相机可控性仍未解决。近期研究尝试将相机控制纳入生成过程中,但结果常仅限于简单轨迹,或缺乏从同一场景生成多个不同相机路径一致视频的能力。为此,我们引入Cavia,一种 novel 框架,用于可控的、多视角视频生成,能够将输入图像转换为多个时空一致视频。我们的框架将空间注意力和时间注意力模块扩展为视图集成注意力模块,提高了视点和时序一致性。这种灵活的设计允许使用多样化精选数据源进行联合训练,包括场景级静态视频、对象级合成多视角动态视频以及真实世界的单目动态视频。据我们所知,Cavia 是首个允许用户精确指定相机运动并获得对象运动的方法。大量实验表明,Cavia 在几何一致性和感知质量方面超越了最先进的方法。项目页面:https://ir1d.github.io/Cavia/
引用
@article{arxiv.2410.10774,
title = {Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention},
author = {Dejia Xu and Yifan Jiang and Chen Huang and Liangchen Song and Thorsten Gernoth and Liangliang Cao and Zhangyang Wang and Hao Tang},
journal= {arXiv preprint arXiv:2410.10774},
year = {2024}
}
备注
Project Page: https://ir1d.github.io/Cavia/