中文

大型语言模型注意力头:综述

计算与语言 2024-12-24 v3

摘要

自 ChatGPT 问世以来,大型语言模型(LLM)在各类任务中表现卓越,但仍被视为黑箱系统。理解 LLM 的推理瓶颈已成为关键挑战,因为这些局限性与其内部架构紧密相关。在此背景下,注意力头成为探讨 LLM 内部机制的焦点。本综述旨在通过系统性地探讨注意力头的作用与机制,阐明 LLM 的内部推理过程。我们首先引入一种受人类思维过程启发的四阶段框架,包括知识召回、情境识别、潜在推理与表达准备。在此框架下,我们综述现有研究,识别并归类特定注意力头的功能。此外,我们分析发现这些特殊注意力头的实验方法,将其分为建模无关与建模必需两类。我们进一步总结相关评估方法与基准。最后,讨论当前研究的局限性,并提出若干潜在的未来方向。

关键词

引用

@article{arxiv.2409.03752,
  title  = {Attention Heads of Large Language Models: A Survey},
  author = {Zifan Zheng and Yezhaohui Wang and Yuxin Huang and Shichao Song and Mingchuan Yang and Bo Tang and Feiyu Xiong and Zhiyu Li},
  journal= {arXiv preprint arXiv:2409.03752},
  year   = {2024}
}

备注

33 pages, 11 figures, 7 tables, 7 equations