为评估反事实解释设计以用户为中心的指标
机器学习
2026-03-31 v2
摘要
反事实解释(Counterfactual Explanations, CFEs)因提供可操作性指导而日益受到青睐,通过识别将机器学习模型预测翻转至更理想值的最小特征变化。然而,大多数关于CFEs的现有研究依赖人工评估指标,如接近度(proximity),可能忽视用户偏好和约束,例如用户对特定特征变更所需努力的感知可能不同于模型设计者。在此研究空白处,本文作出三项新贡献。第一项,我们受雇于Amazon MTurk的20名众包工作者进行的初始研究,实证验证了现有CF评估指标与真实世界用户偏好之间的对齐性。结果表明,用户偏好CFEs仅在63.81%的情况下与基于接近度的CFEs相匹配,凸显了这些指标在实际应用中的有限适用性。第二项,受利于设计以用户为中心的CFs评估指标的需要,我们进行了更详尽的两天用户研究,41名参与者在真实的信用申请情境下,以寻找端用户如何评估CFs的假设之实验支持或反对。第三项,基于第二项研究的发现,我们提出了AWP模型,一种新颖的以用户为中心的两阶段模型,描述了用户评估和选择CFs的可能机制之一。我们的结果表明,AWP以84.37%的准确率预测用户偏好CFs。我们的研究为个性化成本模型在CFs生成中的人本中心验证提供了首次支持,并凸显了需要自适应、以用户为中心的评估指标的重要性。
引用
@article{arxiv.2507.15162,
title = {Designing User-Centric Metrics for Evaluation of Counterfactual Explanations},
author = {Firdaus Ahmed Choudhury and Ethan Leicht and Jude Ethan Bislig and Hangzhi Guo and Amulya Yadav},
journal= {arXiv preprint arXiv:2507.15162},
year = {2026}
}