Latent-Reframe:无需训练即可实现视频扩散模型的相机控制
计算机视觉与模式识别
2024-12-10 v1
摘要
精确的相机姿态控制对于视频扩散模型的生成至关重要。现有方法需要针对包含成对视频和相机姿态标注的额外数据集进行微调,这既数据密集又计算昂贵,还可能破坏预训练模型的分布。我们提出Latent-Reframe,使预训练视频扩散模型能够在无需微调的情况下实现相机控制。不同于现有方法,Latent-Reframe在采样阶段运行,保持高效同时保留原始模型分布。我们的方法通过时序相关点云重新框选视频帧的潜在代码,以与输入相机轨迹对齐。潜在代码的inpainting和harmonization进一步细化模型潜在空间,确保高质量的视频生成。实验结果表明,Latent-Reframe在不需额外数据集微调的情况下,实现了与基于训练方法相当或更好的相机控制精度和视频质量。
引用
@article{arxiv.2412.06029,
title = {Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training},
author = {Zhenghong Zhou and Jie An and Jiebo Luo},
journal= {arXiv preprint arXiv:2412.06029},
year = {2024}
}
备注
Project Page: https://latent-reframe.github.io