中文

FaithLM:迈向大型语言模型的忠实解释

计算与语言 2025-10-28 v4 人工智能 机器学习

摘要

大型语言模型(LLM)越来越多地生成自然语言解释,然而这些解释往往缺乏忠实性,不能可靠地反映模型用于决策的证据。我们引入了 FaithLM,这是一个与模型无关的框架,可在不进行 token 掩码或使用特定任务启发式方法的情况下评估并提升 LLM 解释的忠实性。FaithLM 将解释的忠实性形式化为一种干预属性:忠实的解释在其内容被反驳时应产生预测偏移。理论分析表明,由此产生的反向提示得分是忠实性的可靠且具区分度的估计量。基于此原则,FaithLM 迭代地优化引出提示和解释,以最大化所测得的得分。在三个多领域数据集和多个 LLM 主干上的实验表明,与强自解释基线相比,FaithLM 能持续提升忠实性,并生成更符合人类逻辑的解释。这些发现表明,基于干预的评估结合迭代优化,为获得忠实且可靠的 LLM 解释提供了一条有原则的途径。

关键词

引用

@article{arxiv.2402.04678,
  title  = {FaithLM: Towards Faithful Explanations for Large Language Models},
  author = {Yu-Neng Chuang and Guanchu Wang and Chia-Yuan Chang and Ruixiang Tang and Shaochen Zhong and Fan Yang and Mengnan Du and Xuanting Cai and Vladimir Braverman and Xia Hu},
  journal= {arXiv preprint arXiv:2402.04678},
  year   = {2025}
}