稀疏反事实解释对不利扰动的鲁棒性研究
机器学习
2022-09-26 v3
摘要
反事实解释(CEs)是理解算法决策如何被改变的有力手段。研究者已提出若干CEs应满足的实际有用性准则,例如要求实施最小努力,或符合因果模型。我们考虑进一步提升CEs可用性的一个方面:对不利扰动的鲁棒性,这类扰动可能由于不利情形自然发生。由于CEs通常规定稀疏的干预形式(即仅改变特征子集),我们分别研究对建议改变的特征与不建议改变的特征处理鲁棒性的效果。我们的定义是可操作的,因为它们可作为惩罚项纳入用于发现CEs的损失函数中。为实验鲁棒性,我们创建并发布了代码,其中五个数据集(常用于公平且可解释机器学习领域)已 enriched 具有可用于采样有意义扰动的特征特定标注。我们的实验表明,CEs常常不鲁棒,且若发生不利扰动(即使非最坏情形),其规定的干预可能比预期成本高得多,甚至变得不可能。然而,在搜索过程中考虑鲁棒性(可较容易地做到)能够系统地发现鲁棒CEs。鲁棒CEs对抵消扰动所需的额外干预远比非鲁棒CEs成本低。我们还发现,对需改变的特征更容易实现鲁棒性,这为选择何种反事实解释对用户最佳提供了重要考量点。我们的代码见:https://github.com/marcovirgolin/robust-counterfactuals。
引用
@article{arxiv.2201.09051,
title = {On the Robustness of Sparse Counterfactual Explanations to Adverse Perturbations},
author = {Marco Virgolin and Saverio Fracaros},
journal= {arXiv preprint arXiv:2201.09051},
year = {2022}
}