中文

图像到视频扩散:从基础到开放前沿

人工智能 2026-05-19 v1

摘要

基于扩散的图像到视频(I2V)生成正在成为生成模型中的核心方向,通过将参考图像(可选地附加条件)转化为时序一致的视频。与更广泛的视频生成设置相比,该任务对内容一致性、身份保持和运动连贯性的要求更为严格。尽管文献 rapidly grows,但现有工作大多在更广泛的主题内讨论 I2V 生成,仍缺乏专门的分类体系以及以该领域为中心的系统分析。本工作将 I2V 生成视为独立学科,首先综述了任务表述、模型架构、数据集和评估指标,然后依据架构和训练范式组织现有方法。进一步提炼出四个核心设计,即条件编码、时序建模、噪声先验设计和空间时序上采样,并讨论了代表性应用场景及主要开放挑战。

关键词

引用

@article{arxiv.2605.17247,
  title  = {Towards Robust Argumentative Essay Understanding via TIDE: An Interactive Framework with Trial and Debate},
  author = {Zheqin Yin and Yupei Ren and Yadong Zhang and Yujiang Lu and Man Lan},
  journal= {arXiv preprint arXiv:2605.17247},
  year   = {2026}
}