无限单幅畸变:相机控制视频生成的鲁棒条件
计算机视觉与模式识别
2025-12-22 v1
摘要
最近的视频扩散模型进展推动了对相机控制的新视角视频生成日益关注的兴趣,旨在为创作者在后期制作中提供电影级相机控制能力。相机控制视频生成的关键挑战是确保与指定相机姿态的忠实度,同时保持视图一致性并从有限观察中推理遮挡几何。为了解决这些问题,现有方法要么是在轨迹-视频对数据集上训练轨迹条件视频生成模型,要么从输入视频估计深度沿目标轨迹进行重投影并生成未被投影的区域。然而,现有方法在两个主要原因下难以生成相机姿态忠实、高质量视频:(1)重投影方法对深度估计不准确导致的错误高度敏感;(2)现有数据集中相机轨迹的有限多样性限制了所学模型。为了解决这些限制,我们提出了 InfCam,一个无深度、相机控制的视频到视频生成框架,具有高位姿忠实度。该框架集成了两个关键组件:(1)无限单幅畸变warping,将 3D 相机旋转直接编码到视频扩散模型的 2D 潜空间中。基于此噪声免除的旋转信息进行条件化,残余视差项通过端到端训练来实现高相机姿态忠实度;(2)将现有合成多视图数据集转换为具有多样化轨迹和焦距的序列的数据增强管道。实验结果表明,InfCam 在相机姿态准确性和视觉保真度方面优于基线方法,能够从合成数据到真实数据良好泛化。项目页面链接:https://emjay73.github.io/InfCam/
引用
@article{arxiv.2512.17040,
title = {Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation},
author = {Min-Jung Kim and Jeongho Kim and Hoiyeong Jin and Junha Hyung and Jaegul Choo},
journal= {arXiv preprint arXiv:2512.17040},
year = {2025}
}