EPiC:基于精确锚点视频引导的高效视频摄像机控制学习
计算机视觉与模式识别
2026-05-29 v2 人工智能
摘要
近期带有摄像机控制的视频生成方法通常创建锚点视频(即近似所需摄像机运动的渲染视频),通过沿着摄像机轨迹渲染估计的点云,将其作为结构化先验来引导扩散模型。然而,点云和摄像机轨迹估计中的误差往往会导致锚点视频不准确,并带来较高的训练成本和低效率,因为模型被迫补偿渲染不对齐的问题。为了解决这些局限性,我们引入了 EPiC,这是一个高效且精确的摄像机控制学习框架,它无需摄像机位姿或点云估计即可构建良好对齐的训练锚点视频。具体而言,我们基于首帧可见性对源视频进行掩码处理来创建高精度锚点视频,这确保了强对齐性,消除了对摄像机/点云估计的需求,从而可以轻松应用于任何野外视频。此外,我们引入了 Anchor-ControlNet,这是一个轻量级模块,将可见区域的锚点视频引导集成到预训练的视频扩散模型中,新增参数不到 1%。EPiC 通过大幅减少参数量、训练步数和数据量实现了高效训练,并在测试时对由点云制作的锚点视频表现出稳健的泛化能力,实现了精确的 3D 信息引导摄像机控制。EPiC 在 RealEstate10K 和 MiraData 数据集上的 I2V 摄像机控制任务中取得了 SoTA 性能。值得注意的是,EPiC 还对视频到视频(V2V)场景表现出强大的零样本泛化能力。
引用
@article{arxiv.2505.21876,
title = {EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance},
author = {Zun Wang and Jaemin Cho and Jialu Li and Han Lin and Jaehong Yoon and Yue Zhang and Mohit Bansal},
journal= {arXiv preprint arXiv:2505.21876},
year = {2026}
}
备注
Accepted to ICML 2026. Project website: https://zunwang1.github.io/Epic