中文

∇NABLA:邻域自适应块级注意力

计算机视觉与模式识别 2025-07-21 v1

摘要

最近的基于transformer的架构在视频生成任务中展现出显著的成功。然而,完整注意力机制的二次复杂度仍是高分辨率和长时长视频序列中的关键瓶颈。本文提出NABLA(Neighborhood Adaptive Block-Level Attention),一种 novel 的邻域自适应块级注意力机制,动态适应视频扩散transformer (DiTs) 中的稀疏性模式。通过利用具有自适应稀疏性驱动阈值的块级注意力,NABLA 在保持生成质量的同时降低了计算开销。 our 方法无需自定义低级算子设计,可无缝集成到 PyTorch 的 Flex Attention operator 中。实验表明,NABLA 在训练和推理方面相较于 baseline 速度提升最高可达 2.7 倍,几乎不损失定量指标(CLIP score、VBench score、人类评估 score)和视觉质量。代码和模型权重可在 https://github.com/gen-ai-team/Wan2.1-NABLA 获取。

关键词

引用

@article{arxiv.2507.13546,
  title  = {$\nabla$NABLA: Neighborhood Adaptive Block-Level Attention},
  author = {Dmitrii Mikhailov and Aleksey Letunovskiy and Maria Kovaleva and Vladimir Arkhipkin and Vladimir Korviakov and Vladimir Polovnikov and Viacheslav Vasilev and Evelina Sidorova and Denis Dimitrov},
  journal= {arXiv preprint arXiv:2507.13546},
  year   = {2025}
}