注意力机制在资源利用方面的比较研究:自注意力变体的细致分析
机器学习
2025-07-11 v1 人工智能
神经与进化计算
摘要
随着大型语言模型(LLM)和视觉语言模型(VLM)的规模和应用不断增长,注意力机制已成为计算瓶颈,其高内存和时间复杂度亦使其成为中心性计算瓶颈。虽然已提出许多高效注意力变体,但仍缺乏对其实际能源使用和硬件资源需求的严格评估。在本工作中,我们对八种注意力机制在 GPT-2 架构上的训练进行基准测试,测量关键指标,包括训练时间、GPU 内存使用、FLOPS、CPU 使用情况和功耗。我们的结果表明,采用优化内核实现的注意力机制,包括 Flash Attention、局部敏感哈希(LSH)注意力和多头潜在注意力(MLA),在能源效率方面表现最佳。我们进一步表明,GPU 功率降低并不一定保证能源消耗减少,因为训练时间同样重要。我们的研究凸显了注意力设计中进行能源感知基准测试的重要性,并为选择资源高效机制提供了实用见解。所有代码已在 GitHub 上开放。
引用
@article{arxiv.2507.07247,
title = {Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention},
author = {Zhengyu Tian and Anantha Padmanaban Krishna Kumar and Hemant Krishnakumar and Reza Rawassizadeh},
journal= {arXiv preprint arXiv:2507.07247},
year = {2025}
}
备注
6 pages, 8 figures