中文

基于输入梯度空间对齐的可解释性鲁棒训练

计算机视觉与模式识别 2020-07-21 v4 机器学习 图像与视频处理

摘要

可解释性是可信机器学习中的一个新兴研究领域。机器学习系统的安全部署要求预测及其解释可靠且鲁棒。最近研究表明,可在保持模型预测不变的情况下,通过对输入添加视觉上难以察觉的扰动轻易操纵解释。本文通过给出可解释性脆弱性关于输入图像与其解释图之间空间相关性的上界,研究可解释性鲁棒性(即具有鲁棒解释的模型)问题。我们提出一种训练方法,利用软间隔三元组损失最小化该上界以学习鲁棒特征。我们所提出的鲁棒归因训练(ART)方法在 SVHN、CIFAR-10 和 GTSRB 等多个标准数据集上以约 6-18% 的优势取得了新的最先进可解释性鲁棒性度量。我们进一步展示了所提出的鲁棒训练技术(ART)在弱监督目标定位下游任务中的效用,在 CUB-200 数据集上取得了新的最先进性能。

关键词

引用

@article{arxiv.1911.13073,
  title  = {Attributional Robustness Training using Input-Gradient Spatial Alignment},
  author = {Mayank Singh and Nupur Kumari and Puneet Mangla and Abhishek Sinha and Vineeth N Balasubramanian and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:1911.13073},
  year   = {2020}
}

备注

ECCV 2020, Code at https://github.com/nupurkmr9/Attributional-Robustness