复制抑制:全面理解一个注意力头
机器学习
2023-10-10 v1 人工智能
计算与语言
摘要
我们在 GPT-2 Small 中呈现了一个在整体训练分布中具有单一主要作用的注意力头。如果前面层的组件预测了某个特定词元,且该词元在上下文中较早出现,该头会抑制它:我们称之为复制抑制。注意力头 10.7(L10H7)抑制朴素复制行为,从而改善整体模型校准。这解释了为何先前多项针对某些狭窄任务的研究发现了系统性偏好错误答案的负向头。我们通过基于权重的证据揭示了负向头用于复制抑制的机制,并能够解释 GPT-2 Small 中 L10H7 影响的 76.9%。据我们所知,这是迄今为止对语言模型中一个组件完整作用最全面的描述。复制抑制的一个主要效应是其在自修复中的作用。自修复指消融关键模型组件后下游神经网络部分对此消融进行补偿的现象。复制抑制导致自修复:如果初始过度自信的复制者被消融,则无可抑制之物。我们展示了自修复由若干机制实现,其中之一是复制抑制,其在狭窄任务中解释了 39% 的行为。复制抑制现象的交互式可视化可在我们的 Web 应用 https://copy-suppression.streamlit.app/ 查看。
引用
@article{arxiv.2310.04625,
title = {Copy Suppression: Comprehensively Understanding an Attention Head},
author = {Callum McDougall and Arthur Conmy and Cody Rushing and Thomas McGrath and Neel Nanda},
journal= {arXiv preprint arXiv:2310.04625},
year = {2023}
}