通过数据投毒欺骗部分依赖图
机器学习
2023-03-21 v3 机器学习
摘要
人们已开发许多方法来理解复杂预测模型,并对事后模型可解释性寄予厚望。事实证明此类解释既不稳健也不可信,且可被欺骗。本文提出攻击部分依赖(图、剖面、PDP)的技术,部分依赖是解释任何在表格数据上训练的预测模型最流行的方法之一。我们展示 PD 可被以对抗方式操纵,这令人警觉,尤其在金融或医疗应用中,可审计性已成为支持黑盒机器学习必备特性。欺骗通过投毒数据,利用遗传与梯度算法将解释按期望方向弯曲与偏移来实现。我们认为这是首个使用遗传算法操纵解释的工作,其具有可迁移性,因它以模型无关与解释无关的方式双向泛化。
引用
@article{arxiv.2105.12837,
title = {Fooling Partial Dependence via Data Poisoning},
author = {Hubert Baniecki and Wojciech Kretowicz and Przemyslaw Biecek},
journal= {arXiv preprint arXiv:2105.12837},
year = {2023}
}
备注
Accepted at ECML PKDD 2022