中文

FreqFormer:基于层次频率域注意力与自适应光谱路由的长序列视频扩散变换器

计算机视觉与模式识别 2026-04-28 v1 人工智能 图像与视频处理

摘要

长序列视频扩散变换器的自注意力计算复杂度呈二次增长,在非常长的 token 序列上主导运行时间和内存消耗。大多数高效注意力方法在所有位置都采用一种近似方法,而视频特征在谱上具有结构性:低频携带全局布局和粗糙运动;高频携带纹理和细节。我们提出 FreqFormer,一种频率感知的异构注意力框架。将 token 特征分割为不同频带,并在不同频带上使用不同的算子:对压缩后的低频内容进行稠密全局注意力;对中频进行结构化块稀疏注意力;对高频进行滑动窗口局部注意力。轻量级光谱路由网络根据层统计信息和扩散时间步,分配注意力头跨越各频带,early in denoising 时将计算资源倾向于全局结构,later 时倾向于细节。跨频带摘要 token 提供廉价的残差交换。FreqFormer 配合融合 GPU 执行计划,协调稠密、稀疏和局部分支,显著减少 kernel 调用和内存流量。我们给出一致的复杂度模型、正交分解视角下的近似分析,以及基于仿真的系统性能数据(吞吐量、算术强度、内存流量、持续时间扩展)。在 64K 到 1M token 的仿真中,FreqFormer 在保持硬件友好模式的前提下,显著降低稠密注意力下的注意力 FLOPs 和 KV 相关内存流量,支持频率结构化的异构注意力作为长视频扩散变换器的实用方案。

关键词

引用

@article{arxiv.2604.22808,
  title  = {FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers},
  author = {Haopeng Jin},
  journal= {arXiv preprint arXiv:2604.22808},
  year   = {2026}
}

备注

24 pages, 17 figures, 14 tables, Technical Report