语言模型中上下文利用的高亮解释评估框架
计算与语言
2026-04-28 v3
摘要
上下文利用(context utilisation)——语言模型(LMs)在生成响应时整合提供的上下文相关信息的能力——对用户而言仍然很大程度上是不透明的,用户无法判断模型是从参数化记忆中还是从提供的上下文中提取信息,也无法识别哪些具体的上下文片段影响了响应。高亮解释(HEs)提供了一种自然的解决方案,因为它们可以指向影响模型输出的确切上下文片段和标记。然而,现有工作尚未评估其在准确解释上下文利用方面的有效性。我们通过引入首个用于上下文归因的高亮解释黄金标准评估框架来解决这一空白,该框架使用已知真实上下文利用情况的控制测试用例,避免了现有间接代理评估的局限性。为了展示该框架的广泛适用性,我们在四种上下文场景、四种数据集和五种语言模型上评估了四种 HE 方法——三种成熟技术和一种为此任务适配的机制可解释性方法 MechLight。总体而言,我们发现 MechLight 在所有上下文场景中表现最佳。然而,所有方法在处理较长上下文时均遇到困难,并表现出位置偏差,指向了解释准确性方面的根本性挑战,需要新的方法才能在大规模场景下提供可靠的上下文利用解释。
引用
@article{arxiv.2510.02629,
title = {Evaluation Framework for Highlight Explanations of Context Utilisation in Language Models},
author = {Jingyi Sun and Pepa Atanasova and Sagnik Ray Choudhury and Sekh Mainul Islam and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2510.02629},
year = {2026}
}