聊得来得去吗?衡量大型语言模型解释的忠实性
计算与语言
2025-05-21 v2 人工智能
机器学习
机器学习
摘要
大型语言模型(LLM)能够生成对其如何回答问题的解释,这些解释看起来是合理的。然而,这些解释可能误刻画了模型的“推理”过程,即它们可能是不忠实的。这种情况会导致过度信任和滥用。我们提出了一种新方法来衡量大型语言模型解释的忠实性。首先,我们提供了对忠实性的严格定义。由于大型语言模型解释模仿人类解释,它们常常引用输入问题中高层次的概念,声称这些概念影响了模型。我们将忠实性定义为大型语言模型解释暗示哪些概念是有影响力的集合与事实上真正有影响力的概念集合之间的差异。其次,我们提出了一种基于:(1)使用辅助大型语言模型修改模型输入中概念的值以创建真实的反事实样本,以及(2)使用贝叶斯层次模型在样本级和数据集级量化概念的因果效应的方法来估计忠实性的新方法。我们的实验表明,该方法可用于量化并发现可解释的不忠实模式。在社交偏见任务中,我们发现大型语言模型解释掩盖了社交偏见的影响。在医学问答任务中,我们发现大型语言模型解释提供了关于哪些证据影响了模型决策的误导性陈述。
引用
@article{arxiv.2504.14150,
title = {Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations},
author = {Katie Matton and Robert Osazuwa Ness and John Guttag and Emre Kıcıman},
journal= {arXiv preprint arXiv:2504.14150},
year = {2025}
}
备注
66 pages, 14 figures, 40 tables; ICLR 2025 (spotlight) camera ready