中文

向忠实性迈出必要一步:衡量和改进自由文本解释中的一致性

计算与语言 2025-09-30 v2 人工智能

摘要

忠实的自由文本解释对于确保高风险AI决策情境下的透明度至关重要,但它们对语言模型而言难以生成,对人类评估也存在挑战。本文提出了一种用于衡量预测-解释(PEX)一致性的度量方法,通过延伸证据权重(concept of weight of evidence)的概念。该度量量化了自由文本解释是如何支持或反对预测,从而成为解释忠实性的一个重要方面。我们的分析揭示,超过62%的大型语言模型生成的解释缺乏这种一致性。我们展示,通过应用直接偏好优化(Direct Preference Optimization),可在三个模型家族中提升生成解释的一致性,改进幅度范围为43.1%至292.3%。此外,我们进一步证明,优化这一一致性度量可使解释忠实性提升最高达9.7%。

关键词

引用

@article{arxiv.2505.19299,
  title  = {A Necessary Step toward Faithfulness: Measuring and Improving Consistency in Free-Text Explanations},
  author = {Lingjun Zhao and Hal Daumé},
  journal= {arXiv preprint arXiv:2505.19299},
  year   = {2025}
}

备注

EMNLP 2025