FreeSwim:重访滑动窗口注意力机制用于无训练超高分辨率视频生成
计算机视觉与模式识别
2025-12-02 v2
摘要
现代基于 Transformer 的视频生成器中注意力机制的二次时间和内存复杂度,使得为超高分辨率视频进行端到端训练变得代价高昂。为了克服这一限制,我们引入一种无训练方法,利用预训练于本机尺度的视频扩散 Transformer 来合成更高分辨率的视频,而无需任何额外训练或适应。我们方法的核心在于一种内部滑动窗口注意力机制,这源于一个关键观察:保持每个查询 token 的训练尺度感受野对于保持视觉保真度和细节至关重要。然而,朴素的局部窗口注意力不幸常常导致内容重复,并在生成结果中表现出缺乏全局一致性。为克服这一挑战,我们构建了一个双路径管道,用一种新颖的跨注意力覆盖策略来支撑窗口注意力,使局部注意力产生的语义内容能够由另一个拥有完整感受野的分支所引导,从而确保整体一致性。此外,为提高效率,我们采用跨注意力缓存策略来避免频繁计算完整的 3D 注意力。广泛的实验表明,我们的方法在无训练范式下实现了具有精细视觉细节的超高分辨率视频,同时具有高效性。与训练性方法相比,在 VBench 上实现卓越的性能,同时保持竞争或改进的效率。代码可在 https://github.com/WillWu111/FreeSwim 查看。
关键词
引用
@article{arxiv.2511.14712,
title = {FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation},
author = {Yunfeng Wu and Jiayi Song and Zhenxiong Tan and Zihao He and Songhua Liu},
journal= {arXiv preprint arXiv:2511.14712},
year = {2025}
}
备注
23 pages, 14 figures