语言模型中绑定机制的表征分析
计算与语言
2024-10-28 v3
摘要
实体跟踪对于复杂推理至关重要。为了执行上下文中的实体跟踪,语言模型 (LM) 必须将实体与其属性绑定(例如,将容器与其内容物绑定),以便回忆起给定实体的属性。例如,给定一个提及“咖啡在盒子 Z 中,石头在盒子 M 中,地图在盒子 H 中”的上下文,为了稍后推断出“盒子 Z 装有咖啡”,LM 必须将“盒子 Z”与“咖啡”绑定。为了解释 LM 的绑定行为,现有研究引入了绑定 ID 机制,并指出 LM 使用一种称为绑定 ID (BI) 的抽象概念在内部标记实体-属性对。然而,他们并未从直接决定绑定行为的实体激活中捕获排序 ID (OI)。在本工作中,我们通过定位 OI 并证明 OI 与绑定行为之间的因果关系,提供了一种对 BI 机制的新视角。具体而言,通过利用降维方法(如 PCA),我们发现 LM 的激活中存在一个低秩子空间,它主要编码实体和属性的顺序(即 OI)。此外,我们还发现了 OI 对绑定的因果效应:当沿着 OI 编码方向编辑表征时,LM 倾向于将给定实体相应地绑定到其他属性。例如,通过沿着 OI 编码方向修补激活,我们可以使 LM 推断出“盒子 Z 装有石头”和“盒子 Z 装有地图”。
引用
@article{arxiv.2409.05448,
title = {Representational Analysis of Binding in Language Models},
author = {Qin Dai and Benjamin Heinzerling and Kentaro Inui},
journal= {arXiv preprint arXiv:2409.05448},
year = {2024}
}