中文

NeuroFaith:基于内部表示对齐评估 LLM 自我解释忠诚性

计算与语言 2026-01-30 v4

摘要

大型语言模型 (LLM) 可以生成合理的自由文本自我解释,以为其答案提供依据。然而,这些自然语言解释可能不准确地反映模型的实际推理过程,凸显了忠诚性不足的问题。现有的忠诚性评估方法主要依赖行为测试或计算块分析,却未检查内部神经表示的语义内容。本文提出了 NeuroFaith,一个灵活的框架,通过识别解释中的关键概念并机械性地测试这些概念是否实际影响模型的预测,从而衡量 LLM 自由文本自我解释的忠诚性。我们展示了 NeuroFaith 在 2-hop 推理和分类任务中的灵活性。此外,我们开发了一个基于 NeuroFaith 的线性忠诚探针,用于从表示空间中检测不忠诚的自我解释并通过引导提高忠诚性。NeuroFaith 为评估和提高 LLM 自由文本自我解释的忠诚性提供了原则方法,解决了可信赖 AI 系统的关键需求。

关键词

引用

@article{arxiv.2506.09277,
  title  = {NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment},
  author = {Milan Bhan and Jean-Noel Vittaut and Nicolas Chesneau and Sarath Chandar and Marie-Jeanne Lesot},
  journal= {arXiv preprint arXiv:2506.09277},
  year   = {2026}
}