中文

ENA:高效N维注意力机制

机器学习 2025-08-19 v1 人工智能 计算机视觉与模式识别

摘要

高阶数据长序列的高效建模需要超过Transformer的更高效架构。本文探讨了将线性循环模型(尤其是最初用于语言建模的模型)扩展到高阶数据(从1D到ND)的两个关键方面:扫描策略和注意力混合架构。经验结果表明,扫描提供的益处有限,而注意力混合模型取得了有前景的效果。聚焦于后者,我们进一步评估了不同类型的注意力机制,发现以瓦片化高阶滑动窗口注意力(SWA)在理论和实践中都高效。我们将线性循环与高阶SWA混合架构称为高效N维注意力(ENA)。随后我们进行了若干实验以证明其有效性。ENA的直觉在于:线性循环将全局信息压缩到状态中,而SWA通过严格的局部建模来补充其作用。两者共同构成一个简单却为超长高阶数据建模提供了有前景且实用的解决方案的框架。

关键词

引用

@article{arxiv.2508.11921,
  title  = {ENA: Efficient N-dimensional Attention},
  author = {Yibo Zhong},
  journal= {arXiv preprint arXiv:2508.11921},
  year   = {2025}
}

备注

WIP