ReHyAt:用于视频扩散变换器的循环混合注意力
计算机视觉与模式识别
2026-01-09 v1
摘要
近期视频扩散模型的进展正向基于变换器的架构发展,实现了最新的视频生成,但以二次注意力复杂度为代价,这严重限制了对更长序列的可扩展性。我们引入了 ReHyAt,一种循环混合注意力机制,组合了软最大注意力的保真度与线性注意力的效率,使其能够进行块状循环重构并实现恒定内存使用。与concurrent的线性注意力SANA Video模型相比,ReHyAt的混合设计允许从现有的基于软最大注意力的模型进行高效蒸馏训练,使训练成本降低两个数量级,约为160个GPU小时,同时在质量方面保持竞争力。我们的轻量化蒸馏和微调管道提供了一种可应用于未来最先进的双向软最大注意力模型的配方。在VBench和VBench-2.0上的实验,以及人类偏好研究,均表明ReHyAt在保持注意力成本从二次降至线性的同时,实现了最新的视频质量,解锁了对长时长和移动端视频生成的实际可扩展性。项目页面可在 https://qualcomm-ai-research.github.io/rehyat 查看。
引用
@article{arxiv.2601.04342,
title = {ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers},
author = {Mohsen Ghafoorian and Amirhossein Habibian},
journal= {arXiv preprint arXiv:2601.04342},
year = {2026}
}