FAR:一种归因鲁棒性的通用框架
机器学习
2022-03-09 v2
摘要
归因图是解释神经网络预测的热门工具。通过为每个输入维度分配一个代表其对输出影响的重要性值,它们给出了对决策过程的直观解释。然而,近期工作发现了这些图对难以察觉的对抗性扰动的脆弱性,这在医疗等安全相关领域可能是关键的。因此,我们定义了一种新颖的通用归因鲁棒性框架(FAR),作为训练具有鲁棒归因的模型的通用问题表述。该框架由一个通用正则化项和训练目标组成,用于最小化输入局部邻域内归因图的最大不相似度。我们表明 FAR 是当前已有训练方法的一种广义、约束更少的形式化。我们随后提出该框架的两个新实例,AAT 和 AdvAAT,它们直接同时优化鲁棒归因与预测。在广泛使用的视觉数据集上的实验表明,我们的方法在归因鲁棒性上优于或可与当前方法相媲美,同时具有更广泛的适用性。我们最后表明,我们的方法缓解了归因鲁棒性与某些训练和估计参数之间不期望的依赖关系,而这些依赖似乎会关键地影响其他竞争方法。
引用
@article{arxiv.2010.07393,
title = {FAR: A General Framework for Attributional Robustness},
author = {Adam Ivankay and Ivan Girardi and Chiara Marchiori and Pascal Frossard},
journal= {arXiv preprint arXiv:2010.07393},
year = {2022}
}