中文

LExT:评估自然语言解释可信度的框架

计算与语言 2025-11-13 v1

摘要

随着大型语言模型 (LLM) 越来越多地集成到高风险领域,已提出了几种方法来生成自然语言解释。这些解释对于增强模型的可解释性至关重要,尤其是在医疗保健等敏感领域,透明度和可靠性是关键。在这些由 LLM 生成的解释以及其已知关切的背景下,迫切需要 robust 的评估框架来衡量模型生成的解释。自然语言生成指标如 BLEU 和 ROUGE 捕捉语法和语义准确性,但忽略了其他关键方面,如事实准确性、一致性和忠实性。为弥合这一差距,我们提出了衡量自然语言解释可信度的通用框架,平衡 Plausibility 与 Faithfulness,以导出综合性的 Language Explanation Trustworthiness Score (LExT)。(我们的代码和实验复现环境已公开于 https://github.com/cerai-iitm/LExT。)将我们域无关的框架应用于医疗保健领域并使用公共医疗数据集,我们评估了六个模型,包括特定领域模型和通用模型。我们的发现表明,这些模型在生成可信解释方面的能力存在显著差异。对比这些解释,我们观察到通用模型在忠实性方面表现出不一致性,并且倾向于超越特定领域微调的模型。这一工作进一步突显了在敏感领域使用定制化评估框架来评估自然语言解释的重要性,为改善医疗保健及其他领域语言模型的可信度和透明度奠定了基础。

关键词

引用

@article{arxiv.2504.06227,
  title  = {LExT: Towards Evaluating Trustworthiness of Natural Language Explanations},
  author = {Krithi Shailya and Shreya Rajpal and Gokul S Krishnan and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:2504.06227},
  year   = {2025}
}