大型语言模型如何学习上下文?上下文头的查询与键矩阵是度量学习的两座塔
计算与语言
2024-09-26 v3 机器学习
摘要
我们研究了在具有语义无关标签("foo"/"bar")的句子分类任务中上下文学习 (ICL) 的机制。我们发现,仅干预 1% 的头(称为“上下文头”)就会显著影响 ICL 准确率,使其从 87.6% 降至 24.4%。为了理解这一现象,我们分析了这些头中的值输出向量,发现每个标签位置的向量都包含有关相应标签的大量信息。此外,我们观察到从"foo"到"bar"的预测偏移是由于这些头在"foo"和"bar"位置的注意力分数分别减少和增加所致。因此,我们提出了一个关于 ICL 的假设:在上下文头中,值输出矩阵提取标签特征,而查询 - 键矩阵计算最后一个位置的特征与每个标签位置的特征之间的相似度。查询矩阵和键矩阵可被视为两座塔,用于学习最后一个位置的特征与标签位置的每个演示之间的相似度度量。利用这一假设,我们解释了 ICL 中的多数标签偏差和新近性偏差,并提出了两种方法分别将这些偏差降低了 22% 和 17%。
引用
@article{arxiv.2402.02872,
title = {How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning},
author = {Zeping Yu and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2402.02872},
year = {2024}
}
备注
Accepted by EMNLP 2024 main. Mechanistic interpretability for in-contexting in large language models