Infinity-RoPE:从自回归自滚动中涌现可控制的无限视频生成
计算机视觉与模式识别
2026-03-20 v3
摘要
当前自回归视频扩散模型受限于三个核心瓶颈:(i)由基础模型的 3D 滚动位置嵌入(3D-RoPE)强加的有限时间视野,(ii)在持续的长格式滚动中维持细粒度动作控制的响应缓慢,(iii)无法在单个生成流中实现不连续的电影转场。我们提出 -RoPE,一个统一的推理时框架,通过三个相互关联的组件来解决这三个限制:块相对 RoPE、KV 刷新和 RoPE 切割。块相对 RoPE 将时间编码重新表述为移动的局部参考框架,其中每个新生成的潜在块相对于基础模型的最大帧视野进行旋转,而早期块则逆向旋转以保持相对时间几何。这种相对论方法消除了固定的时间位置,从而实现远超基础位置限制的连续视频生成。为获得在不重新编码的情况下进行细粒度动作控制,KV 刷新通过仅保留两个潜在帧——全局汇聚点和最近生成的潜在帧来刷新 KV 缓存,从而确保即时响应。最后,RoPE 切割在时间 RoPE 坐标中引入受控的离散性,实现单个连续滚动中的多段场景转场。综上,-RoPE 作为一个无训练的基础,为无限视野、可控且电影化的视频扩散提供了支持。全面的实验表明,-RoPE 在 VBench 整体得分上 consistently 超越了以前的自回归模型。
引用
@article{arxiv.2511.20649,
title = {Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout},
author = {Hidir Yesiltepe and Tuna Han Salih Meral and Adil Kaan Akan and Kaan Oktay and Pinar Yanardag},
journal= {arXiv preprint arXiv:2511.20649},
year = {2026}
}
备注
CVPR 2026 | Project Page: https://infinity-rope.github.io/