中文

图像到视频扩散:从基础到开放前沿

计算机视觉与模式识别 2026-05-19 v1

摘要

基于扩散模型的图像到视频(image-to-video, I2V)生成正在成为生成模型中的核心方向,通过将参考图像(可选地结合其他条件)转化为具有时序一致性的视频。与更广泛的视频生成任务相比,I2V任务对内容一致性、身份保持和运动连贯性的要求更为严格。尽管文献在快速增长,但现有工作大多在更广泛的主题下讨论I2V生成,仍缺乏专门的分类框架以及围绕该领域的系统性分析。本工作将扩散I2V生成视为一个独立学科,首先回顾了任务定义、模型架构、数据集和评估指标,然后基于模型架构和训练范式对现有方法进行分类。进一步提炼出四个核心设计,即条件编码、时序建模、噪声先验设计和空间时序上采样,并讨论了代表性应用场景以及主要开放挑战。

关键词

引用

@article{arxiv.2605.17248,
  title  = {Image-to-Video Diffusion: From Foundations to Open Frontiers},
  author = {Xianlong Wang and Wenbo Pan and Shijia Zhou and Ke Li and Yuqi Wang and Zeyu Ye and Hangtao Zhang and Leo Yu Zhang and Xiaohua Jia},
  journal= {arXiv preprint arXiv:2605.17248},
  year   = {2026}
}