鲁棒归因正则化
机器学习
2019-10-29 v3 人工智能
密码学与安全
机器学习
摘要
可信机器学习中的一个新兴问题是训练能够为其预测产生鲁棒解释的模型。我们通过神经网络公理化归因的视角,朝解决该问题迈出了一步。我们的理论基于近期工作——积分梯度(IG),其对神经网络输出变化归因于输入变化进行了公理化。我们在经典鲁棒优化模型中提出训练目标以实现鲁棒的 IG 归因。我们的目标对先前为鲁棒预测设计的目标给出了原理性推广,并且对单层神经网络自然退化为经典软间隔训练。我们还推广了先前的理论,并证明不同鲁棒优化模型的目标密切相关。实验证明了我们方法的有效性,也指出了引人深思的问题,暗示需要更好的优化技术或更好的神经网络架构用于鲁棒归因训练。
引用
@article{arxiv.1905.09957,
title = {Robust Attribution Regularization},
author = {Jiefeng Chen and Xi Wu and Vaibhav Rastogi and Yingyu Liang and Somesh Jha},
journal= {arXiv preprint arXiv:1905.09957},
year = {2019}
}