中文

后继头:真实模型中反复出现的可解释注意力头

机器学习 2023-12-15 v1 人工智能 计算与语言

摘要

在这项工作中,我们提出后继头(successor heads):即对边具有自然顺序的令牌(如数字、月份和日期)进行递增的注意力头。例如,后继头将“Monday”递增为“Tuesday”。我们用一种根植于机制可解释性(mechanistic interpretability)的方法来解释后继头行为,该领域旨在以人类可理解的术语解释模型如何完成任务。该领域的现有研究在小型玩具模型中发现了可解释的语言模型组件。然而,玩具模型中的结果尚未带来解释前沿模型内部机制的见解,且目前对大型语言模型(LLMs)的内部操作知之甚少。本文中,我们分析了大型语言模型(LLMs)中后继头的行为,发现它们实现了不同架构共有的抽象表示。它们在参数少至 3100 万、多至至少 120 亿(如 GPT-2、Pythia 和 Llama-2)的 LLMs 中形成。我们发现一组“模 10 特征(mod-10 features)”构成了不同架构和规模的 LLMs 中后继头递增的基础。我们利用这些特征进行向量算术以编辑头行为,并提供了对 LLMs 中数值表示的见解。此外,我们研究了后继头在自然语言数据上的行为,在 Pythia 的一个后继头中识别出可解释的多义性。

关键词

引用

@article{arxiv.2312.09230,
  title  = {Successor Heads: Recurring, Interpretable Attention Heads In The Wild},
  author = {Rhys Gould and Euan Ong and George Ogden and Arthur Conmy},
  journal= {arXiv preprint arXiv:2312.09230},
  year   = {2023}
}

备注

12 main text pages, with appendix