Stable Video Infinity:通过误差循环实现无限时长视频生成
计算机视觉与模式识别
2025-10-13 v1
摘要
我们提出了 Stable Video Infinity (SVI),能够生成长度无限的视频,具有高时序一致性、合情合理的场景转换以及可控的流式叙事线。虽然现有长视频方法试图通过手工防漂移措施(如修改噪声调度器、帧锚定)来缓解累积误差,但仅限于单提示外推,产生单一且重复的运动场景。我们认识到,这一根本性挑战超越了误差累积,关键在于训练假设(看到干净数据)与测试时的自回归现实(以自生成的误差性输出为条件)之间的严重差异。为弥合这一假设差距,SVI 引入误差循环微调,这是一种新型高效训练方法,将扩散转换器(DiT)自身生成的误差循环为监督性提示,从而鼓励 DiT 积极识别和纠正其自身误差。这通过闭环循环、注入、收集和储存误差来实现:具体而言,我们(i)将 DiT 注入的历史误差用于干净输入上进行干预,模拟在流匹配中的误差累积轨迹;(ii)使用单步双向积分高效近似预测并计算残差误差;(iii)在离散化时间步上动态将误差储存到回放记忆中,这些记忆被抽样用于新的输入。SVI 能够将视频规模从几秒钟扩展到无限时长,无需额外推理成本,同时与多样化条件(如音频、骨架和文本流)兼容。我们在三个基准上评估 SVI,包括一致性、创造性和条件设置,充分验证了其多样性和最先进作用。
引用
@article{arxiv.2510.09212,
title = {Stable Video Infinity: Infinite-Length Video Generation with Error Recycling},
author = {Wuyang Li and Wentao Pan and Po-Chien Luan and Yang Gao and Alexandre Alahi},
journal= {arXiv preprint arXiv:2510.09212},
year = {2025}
}
备注
Project Page: https://stable-video-infinity.github.io/homepage/