解码器-only LLM attributions 中受控保留信息的忠诚度评估
计算与语言
2026-05-27 v2 人工智能
机器学习
摘要
大型语言模型 (LLM) 正在通过输入归因方法进行评估,但进行此类解释的比较仍然具有挑战性。现有的软扰动忠诚度指标,如 Soft-NC 和 Soft-NS,可能混淆归因质量与扰动期间保留单词数的关系:具有更大平均得分的归因方法可能保留更多单词,从而获得虚高的得分。为解决此问题,我们提出 -Soft-NC 和 -Soft-NS 评估框架,在相同的预期保留概率下比较归因方法,从而控制保留单词的数量。我们进一步引入 Grad-ELLM,一种针对自回归解码器-only LLM 的梯度基准归因方法,它将梯度-derived 通道重要性与注意力-derived 标记重要性在每个解码步骤中结合。在 Llama 和 Mistral 上的分类和开放生成任务实验表明,Grad-ELLM 在 -Soft-NC 下实现了以完整性为导向的强忠诚度,而在 -Soft-NS 下没有主导方法。我们的评估指标为比较 LLM 的 XAI 方法提供了严格的框架,将推动该领域的进步。
引用
@article{arxiv.2601.03089,
title = {Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information},
author = {Xin Huang and Antoni B. Chan},
journal= {arXiv preprint arXiv:2601.03089},
year = {2026}
}