向忠实性迈出必要一步:衡量和改进自由文本解释中的一致性
计算与语言
2025-09-30 v2 人工智能
摘要
忠实的自由文本解释对于确保高风险AI决策情境下的透明度至关重要,但它们对语言模型而言难以生成,对人类评估也存在挑战。本文提出了一种用于衡量预测-解释(PEX)一致性的度量方法,通过延伸证据权重(concept of weight of evidence)的概念。该度量量化了自由文本解释是如何支持或反对预测,从而成为解释忠实性的一个重要方面。我们的分析揭示,超过62%的大型语言模型生成的解释缺乏这种一致性。我们展示,通过应用直接偏好优化(Direct Preference Optimization),可在三个模型家族中提升生成解释的一致性,改进幅度范围为43.1%至292.3%。此外,我们进一步证明,优化这一一致性度量可使解释忠实性提升最高达9.7%。
引用
@article{arxiv.2505.19299,
title = {A Necessary Step toward Faithfulness: Measuring and Improving Consistency in Free-Text Explanations},
author = {Lingjun Zhao and Hal Daumé},
journal= {arXiv preprint arXiv:2505.19299},
year = {2025}
}
备注
EMNLP 2025