中文

VidCRAFT3:面向图像到视频生成的相机、物体与照明控制

计算机视觉与模式识别 2025-09-29 v4 人工智能 机器学习 多媒体

摘要

可控图像到视频(I2V)生成将参考图像转换为由用户指定控制信号引导的连贯视频。在内容创建工作流程中,对相机运动、物体运动和照明方向的精确同步控制既能提升准确性又能增强灵活性。然而,现有方法通常将这些控制信号分别处理,这主要源于缺乏高质量的联合标注数据集,以及控制空间在不同模态之间的不匹配。我们提出VidCRAFT3,一个统一且灵活的I2V框架,支持独立或联合控制相机运动、物体运动和照明方向,通过集成三个核心组件实现。Image2Cloud从参考图像重建3D点云,以实现精确的相机运动控制。ObjMotionNet将稀疏物体轨迹编码为多尺度光流特征,以指导物体运动。Spatial Triple-Attention Transformer通过平行跨注意力集成照明方向嵌入。为解决联合标注数据稀缺问题,我们策划了包含 per-frame 照明方向标签的VideoLightingDirection(VLD)数据集,采用三阶段训练策略,使模型能在缺乏完全联合标注的情况下实现稳健学习。大量实验表明,VidCRAFT3在控制精度和视觉连贯性方面优于现有方法。代码和数据将公开释放。项目页面:https://sixiaozheng.github.io/VidCRAFT3/。

关键词

引用

@article{arxiv.2502.07531,
  title  = {VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation},
  author = {Sixiao Zheng and Zimian Peng and Yanpeng Zhou and Yi Zhu and Hang Xu and Xiangru Huang and Yanwei Fu},
  journal= {arXiv preprint arXiv:2502.07531},
  year   = {2025}
}