关于反事实解释中樱桃挑选的定义与检测
机器学习
2026-01-09 v1 人工智能
摘要
反事实解释广泛用于说明输入必须如何改变模型才能改变其预测。对于单个实例,可以存在许多有效的反事实解释,这为解释提供者选择符合其偏好叙事的解释开辟了可能,突出表现积极行为而隐藏揭示问题行为的示例。我们正式定义反事实解释的樱桃挑选,基于可接受的解释空间(由生成程序指定)和效用函数。我们随后研究外部审计员检测此类操纵的程度。考虑三种对解释过程的访问层次:完全程序访问、部分程序访问和仅限解释访问,我们显示实际中的检测极其有限。即使在完全程序访问下,樱桃挑选的解释仍可能难以与非樱桃挑选的解释区分,因为有效反事实解释的多样性和解释规范的灵活性提供了足够的自由度,以掩盖故意选择。实验上,我们演示了这种变异性通常超过樱桃挑选对标准反事实质量指标(如接近度、可信度和稀疏度)的影响,使樱桃挑选的解释在统计上与基线解释无法区分。我们认为,安全措施应优先考虑可重复性、标准化和程序约束,而非事后检测,我们为算法开发者、解释提供者和审计员提供了建议。
引用
@article{arxiv.2601.04977,
title = {On the Definition and Detection of Cherry-Picking in Counterfactual Explanations},
author = {James Hinns and Sofie Goethals and Stephan Van der Veeken and Theodoros Evgeniou and David Martens},
journal= {arXiv preprint arXiv:2601.04977},
year = {2026}
}