用于忠实自然语言解释的自我批评与优化
计算与语言
2025-09-09 v2
摘要
随着大型语言模型(LLM)的快速发展,自然语言解释(NLE)对于理解模型预测变得越来越重要。然而,这些解释往往不能忠实地反映模型的真实推理过程。虽然现有工作表明LLM能够对各种任务的初始输出进行自我批评与优化,但这一能力在提升解释忠实度方面仍有待探索。为填补这一空白,我们引入了用于自然语言解释的自我批评与优化(SR-NLE)框架,该框架使模型能够通过迭代批评与优化过程,在无外部监督的情况下提升其自身解释(特别是事后NLE)的忠实度。我们的框架利用不同的反馈机制来指导优化过程,包括自然语言自我反馈,以及 notably,一种基于特征归因的全新反馈方法,该方法能够突出重要的输入词。我们在三个数据集和四个SOTA LLM上的实验表明,SR-NLE显著降低了不忠实率,我们最佳的方法实现了平均36.02%的不忠实率,而基线为54.81%——绝对降低了18.79%。这些发现表明,所研究的LLM确实能够优化其解释以更好地反映其真实的推理过程,只需通过反馈进行适当引导,而无需额外训练或微调。
引用
@article{arxiv.2505.22823,
title = {Self-Critique and Refinement for Faithful Natural Language Explanations},
author = {Yingming Wang and Pepa Atanasova},
journal= {arXiv preprint arXiv:2505.22823},
year = {2025}
}
备注
EMNLP 2025 Main