迈向反事实解释的统一评估:利用大语言模型进行以人为中心的评价
人工智能
2025-04-23 v3 计算与语言
摘要
随着机器学习模型的演进,保持透明度需要更多以人为中心的可解释人工智能技术。反事实解释植根于人类推理,能够识别获得给定输出所需的最小输入变化,因此对于支持决策至关重要。尽管其重要性不言而喻,但这些解释的评估往往缺乏用户研究的支撑,且仍处于碎片化状态,现有指标未能完全捕捉人类视角。为应对这一挑战,我们构建了包含30个反事实场景的多样化集合,并收集了206名受访者在8项评估指标上的评分。随后,我们对不同的大语言模型(LLMs)进行微调,以预测这些指标上的平均或个体人类判断。我们的方法使LLMs在零样本评估中准确率高达63%,在微调后所有指标上的准确率达到85%(基于三分类预测)。预测人类评分的微调模型在评估不同反事实解释框架时提供了更好的可比性和可扩展性。
引用
@article{arxiv.2410.21131,
title = {Towards Unifying Evaluation of Counterfactual Explanations: Leveraging Large Language Models for Human-Centric Assessments},
author = {Marharyta Domnich and Julius Välja and Rasmus Moorits Veski and Giacomo Magnifico and Kadi Tulver and Eduard Barbu and Raul Vicente},
journal= {arXiv preprint arXiv:2410.21131},
year = {2025}
}
备注
This paper extends the AAAI-2025 version by including the Appendix