解释基于 Transformer 的语言模型中事实召回的关键机制
计算与语言
2024-05-27 v4 人工智能
机器学习
摘要
在本文中,我们深入探讨了基于 Transformer 的语言模型 (LLM) 用于事实召回任务的几种机制。我们概述了一个包含三个主要步骤的流程:(1) 给定提示“法国的首都是”,特定任务的注意力头从上下文中提取主题词元(例如“法国”),并将其传递给后续的 MLP。(2) 由于注意力头的输出以相等的权重聚合并添加到残差流中,后续的 MLP 充当“激活”作用,擦除或放大来自各个头的信息。结果,主题词元“法国”在残差流中脱颖而出。(3) 深层 MLP 接收“法国”并生成一个组件,将残差流重定向到正确答案的方向,即“巴黎”。此过程类似于应用隐式函数,如“get\_capital()”,其中参数 是注意力头传递的主题词元信息。为了实现对 MLP 的上述定量和定性分析,我们提出了一种新颖的分析方法,旨在将 MLP 的输出分解为人类可理解的组件。此外,我们在模型的最后一层观察到了一种普遍的反过度自信机制,该机制会抑制正确的预测。我们利用我们的解释来减轻这种抑制,从而提高事实召回的置信度。上述解释在涵盖事实知识各个领域的多种任务上进行了评估,使用了从 GPT-2 系列、1.3B OPT 到 7B Llama-2 的多种语言模型,并在零样本和少样本设置下进行了测试。
引用
@article{arxiv.2403.19521,
title = {Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models},
author = {Ang Lv and Yuhan Chen and Kaiyi Zhang and Yulong Wang and Lifeng Liu and Ji-Rong Wen and Jian Xie and Rui Yan},
journal= {arXiv preprint arXiv:2403.19521},
year = {2024}
}