中文

揭示并利用隐藏注意力汇 sink:通过注意力校准提升大语言模型性能(无需训练)

机器学习 2024-06-25 v1 计算与语言

摘要

注意力是大语言模型(LLMs)卓越成就背后的基本组件,但我们对注意力机制的理解——尤其是注意力分布如何建立——仍有限。鼓励最近研究探索注意力汇在初始 token 中的存在,即尽管缺乏语义重要性,却获得不成比例注意力得分的现象。本文深入探讨了 LLMs 中注意力汇的存在,并寻找出eways 来通过直接优化注意力分布来提升 LLMs 的可实现准确率,而无需进行权重微调。具体而言,本文首先对 LLMs 在推理过程中各种输入和任务上的注意力分布进行了全面可视化。基于这些可视化结果,我们在已知领域中首次发现:(1)注意力汇不仅发生在序列开头,也发生在后续输入 token 中;(2)并非所有注意力汇都对提升 LLMs 的可实现准确率有积极影响。基于我们的发现,我们提出了一种训练-free 注意力校准技术(ACT),该技术在推理时以输入自适应方式自动优化注意力分布。大量实验验证了 ACT 在各种应用中的一致性提升。具体而言,当应用于 Llama-30B 时,ACT 在不同数据集上实现了最高达 7.30% 的准确率提升。我们的代码已公开:https://github.com/GATECH-EIC/ACT。

关键词

引用

@article{arxiv.2406.15765,
  title  = {Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration},
  author = {Zhongzhi Yu and Zheng Wang and Yonggan Fu and Huihong Shi and Khalid Shaikh and Yingyan Celine Lin},
  journal= {arXiv preprint arXiv:2406.15765},
  year   = {2024}
}