中文

SwiftI2V:基于条件分段生成的高分辨率图像到视频生成

计算机视觉与模式识别 2026-05-12 v2

摘要

高分辨率图像到视频(I2V)生成旨在合成逼真的时序动态,同时保留输入图像中细粒度的外观细节。2K 分辨率下,这一任务极具挑战性,而现有方法则存在诸多弱点:1)端到端模型在内存和延迟方面往往难以接受;2)基于低分辨率级联再加上通用视频超分辨率的方法,容易产生幻觉细节并偏离输入图像的局部结构,因为超分辨率阶段未明确以输入图像为条件。为此,我们提出 SwiftI2V,一个针对高分辨率 I2V 的高效框架。遵循广泛使用的两阶段设计,SwiftI2V 通过首先生成低分辨率运动参考以降低 token 成本并减轻建模负担,然后进行强度以图像为条件的 2K 合成,依据运动恢复输入忠实细节,控制开销。具体而言,为提升可扩展性,SwiftI2V 引入条件分段生成(Conditional Segment-wise Generation, CSG),按分段方式合成视频,保持每步 token 预算的上限,并在每个分段内采用双向上下文互动以提升跨段连贯性和输入忠实度。在 VBench-I2V 2K 分辨率测试上,SwiftI2V 的性能与端到端基准相当,同时将总体 GPU 时间降低 202 倍。尤其,它使在单张数据中心 GPU(如 H800)或消费级 GPU(如 RTX 4090)上实现实用的 2K I2V 生成成为可能。

关键词

引用

@article{arxiv.2605.06356,
  title  = {SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation},
  author = {YaoYang Liu and Yuechen Zhang and Wenbo Li and Yufei Zhao and Rui Liu and Long Chen},
  journal= {arXiv preprint arXiv:2605.06356},
  year   = {2026}
}

备注

27 pages, 17 figures