UltraViCo: 突破视频扩散变换器的外推极限
计算机视觉与模式识别
2026-03-03 v2
摘要
尽管取得了进展,视频扩散变换器仍在超出训练长度方面难以泛化,这一挑战我们称之为视频长度外推。我们识别出两种失效模式:模型特定的周期性内容重复和普遍的质量下降。先前的工作通过位置编码尝试解决重复问题,却忽视了质量下降且仅实现有限的外推。在本文中,我们从更根本的视角重新审视这一挑战:注意力图——它们直接支配上下文如何影响输出。我们识别出两种失效模式均源于统一原因:注意力扩散,即超出训练窗口的 token 稀释了所学注意力模式。这导致质量下降,而重复则是当这种扩散演变为由位置编码的谐波特性所诱导的周期性注意力模式时出现的特殊情况。基于此洞察,我们提出 UltraViCo,一种无需训练、即插即用的方法,通过常数衰减因子抑制超出训练窗口的注意力。通过同时解决两种失效模式,我们在广泛的基线方法上实现了优势,无论是在模型和外推比率方面,将外推极限从 2 推进到 4。值得注意的是,在 4 倍外推时,我们的方法在 Dynamic Degree 和影像质量方面分别提升了 233% 和 40.5%。此外,我们的方法可无缝地推广到诸如可控视频合成和编辑等下游任务。
引用
@article{arxiv.2511.20123,
title = {UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers},
author = {Min Zhao and Hongzhou Zhu and Yingze Wang and Bokai Yan and Jintao Zhang and Guande He and Ling Yang and Chongxuan Li and Jun Zhu},
journal= {arXiv preprint arXiv:2511.20123},
year = {2026}
}
备注
ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/