零样本个性化相机运动控制用于图像到视频合成
计算机视觉与模式识别
2026-03-30 v3
摘要
指定细致且引人入目的摄像机运动仍是非专业创作者使用生成工具时的主要难题,导致“表达差距”——通用文本提示无法捕捉电影构思。这一障碍限制了个人创意,并限制了小型企业和教育内容创作者对电影制作的可及性。为此,我们提出了一个基于零样本扩散的框架,用于实现个性化相机运动控制,使从单个参考视频迁移的电影式运动可应用于用户提供的静态图像,而无需 3D 数据、预定义轨迹或复杂图形界面。我们的技术贡献在于采用双 Low-Rank Adaptation (LoRA) 网络进行推理时优化,辅以正交正则化器以鼓励空间外观与时间运动更新之间的分离,同时引入基于单应性的细化策略提供弱几何指导。我们采用新开发的指标 CameraScore 以及两个 distinct 用户研究进行评估。72 名参与者的感知研究表明,我们的方法在运动精度(90.45% 偏好)和场景保真性(70.31% 偏好)方面显著优于现有基线方法。此外,12 名参与者的任务型互动研究确认,我们的工作流程在可用性和创意控制方面显著优于标准文本或预设提示(p < 0.001)。我们希望本工作为未来在 diverse 场景下实现相机运动迁移奠定基础。
引用
@article{arxiv.2504.09472,
title = {Zero-Shot Personalized Camera Motion Control for Image-to-Video Synthesis},
author = {Pooja Guhan and Divya Kothandaraman and Geonsun Lee and Tsung-Wei Huang and Guan-Ming Su and Dinesh Manocha},
journal= {arXiv preprint arXiv:2504.09472},
year = {2026}
}