刻画语言模型中事实回忆的机制
计算与语言
2023-10-25 v1 人工智能
摘要
语言模型(LM)通常必须将预训练时记忆的事实与给定上下文中出现的新信息相整合。这两个来源可能不一致,导致模型内部竞争,且目前不清楚 LM 将如何解决冲突。在一个查询世界首都知识的数据集上,我们研究了此类情形下 LM 行为的分布性和机制性决定因素。具体而言,我们测量 LM 使用反事实前缀(例如,“波兰的首都是伦敦”)覆盖其在预训练中学到的内容(“华沙”)的时间比例。在 Pythia 和 GPT2 上,查询国家(“波兰”)和上下文城市(“伦敦”)的训练频率高度影响模型使用反事实的可能性。然后我们使用头归因来识别在 logits 中促进记忆答案或上下文答案的个别注意力头。通过放大或缩小这些头的值向量,我们可以控制在新数据上使用上下文答案的可能性。该方法仅通过在运行时缩放单个头即可将生成上下文答案的比率提高到 88%。我们的工作为表明我们常能将模型行为定位到特定组件的证据体系做出贡献,并为未来方法如何在运行时动态控制模型行为提供了概念验证。
引用
@article{arxiv.2310.15910,
title = {Characterizing Mechanisms for Factual Recall in Language Models},
author = {Qinan Yu and Jack Merullo and Ellie Pavlick},
journal= {arXiv preprint arXiv:2310.15910},
year = {2023}
}