解释方法中更优的采样可防止柴油门式欺骗
机器学习
2021-01-29 v1 人工智能
密码学与安全
摘要
机器学习模型被用于许多敏感领域,除预测准确性外,其可理解性也很重要。预测模型的可解释性对于确定其偏差与错误原因是必要的,也是用户信心的必要前提。对于复杂的最先进黑盒模型,事后与模型无关的解释技术是一种成熟的解决方案。流行且有效的技术,如 IME、LIME 和 SHAP,使用对实例特征进行扰动来解释单个预测。最近,Slack 等人(2020)对其鲁棒性提出质疑,指出由于所采用的较差扰动采样,其结果可能被操纵。这一弱点将允许敏感模型的所有者进行柴油门式的作弊,他们可以欺骗审查并隐藏其预测模型中可能存在的违背伦理或违法的偏差。这可能削弱公众对机器学习模型的信任,并引发对其使用的法律限制。我们表明,这些解释方法中更优的采样可防止恶意操纵。所提出的采样使用学习训练集分布并生成与训练集更为相似的新扰动实例的数据生成器。我们表明,改进后的采样提升了 LIME 和 SHAP 的鲁棒性,而此前未经测试的方法 IME 本身已是所有这些方法中最鲁棒的。
引用
@article{arxiv.2101.11702,
title = {Better sampling in explanation methods can prevent dieselgate-like deception},
author = {Domen Vreš and Marko Robnik Šikonja},
journal= {arXiv preprint arXiv:2101.11702},
year = {2021}
}