可信自然语言解释:基于大语言模型中的激活掩码研究
计算与语言
2024-11-04 v2
摘要
大语言模型 (LLM) 能够生成令人信服的自然语言解释 (NLE) 以为其答案提供依据。然而,这些解释的可信度不应轻信。近期研究提出了各种方法来衡量 NLE 的可信度,通常通过在解释或特征层面插入扰动来实现。我们认为,这些方法既不完整,也未根据 established definition of faithfulness 进行正确设计。此外,我们强调基于 out-of-distribution samples 的可信度发现存在风险。本文利用一种称为激活掩码 (activation patching) 的因果中介技术来衡量解释对支撑所解释答案的可信度。我们提出的度量指标 Causal Faithfulness 量化了解释与相应模型输出之间因果归因的一致性,作为可信度的指示器。我们在参数从 2B 到 27B 的模型上进行实验,发现接受对齐调优的模型倾向于生成更可信且更合理的解释。我们发现,Causal Faithfulness 是现有可信度测试的一个有前景的改进,考虑了模型的内部计算,避免了可能削弱可信度评估有效性的 out-of-distribution 问题。我们将发布代码于 \url{https://github.com/wj210/Causal-Faithfulness}。
引用
@article{arxiv.2410.14155,
title = {Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models},
author = {Wei Jie Yeo and Ranjan Satapathy and Erik Cambria},
journal= {arXiv preprint arXiv:2410.14155},
year = {2024}
}
备注
Under review