关于对抗鲁棒性与可操作解释之间的权衡
机器学习
2024-07-25 v2
摘要
随着机器学习模型日益应用于各种高风险场景,确保这些模型的预测不仅具有对抗鲁棒性,而且易于向相关利益方解释变得十分重要。然而,尚不清楚这两个概念能否同时实现,或它们之间是否存在权衡。本工作中,我们率先尝试研究对抗鲁棒模型对提供终端用户补救手段的可操作解释的影响。我们从理论与实证上分析了当底层模型为对抗鲁棒与非鲁棒时,最先进算法输出的补救方法的代价(实施难易度)与有效性(获得正模型预测的概率)。更具体地,我们推导了最先进算法为对抗鲁棒与非鲁棒线性和非线性模型生成的补救方法在代价与有效性上差异的理论界。我们在多个真实数据集上的实证结果验证了理论结果,并展示了模型鲁棒性不同程度对所得补救方法代价与有效性的影响。我们的分析表明,对抗鲁棒模型显著增加了所得补救方法的代价并降低了其有效性,从而揭示了对抗鲁棒性与可操作解释之间固有的权衡。
引用
@article{arxiv.2309.16452,
title = {On the Trade-offs between Adversarial Robustness and Actionable Explanations},
author = {Satyapriya Krishna and Chirag Agarwal and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2309.16452},
year = {2024}
}
备注
Accepted in the 7th AAAI Conference on AI, Ethics, and Society, 2024