RIFLEx:视频扩散 Transformer 中长度外推的免费午餐
计算机视觉与模式识别
2025-08-08 v3
摘要
最近的视频生成技术使得能够合成高质量的分钟级视频。然而,生成更长的视频仍面临时间一致性挑战,现有长度外推方法导致时间重复或运动减缓。本文系统性分析了位置嵌入中频率分量的作用,识别出主导外推行为的内在频率。基于此洞见,我们提出了 RIFLEx,一种简洁且高效的方法,通过降低内在频率来抑制重复,同时保持运动一致性,无需任何额外修改。RIFLEx 提供了真正的免费午餐——以完全训练无关的方式实现对最先进视频扩散 Transformer 的高质量 2 倍外推。此外,它通过最小微调即可提升质量并实现 3 倍外推,而无需长视频。项目页面与代码:https://riflex-video.github.io/。
引用
@article{arxiv.2502.15894,
title = {RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers},
author = {Min Zhao and Guande He and Yixiao Chen and Hongzhou Zhu and Chongxuan Li and Jun Zhu},
journal= {arXiv preprint arXiv:2502.15894},
year = {2025}
}
备注
ICML 2025. Project page: https://riflex-video.github.io/