面向类激活映射的可认证可解释性鲁棒性
机器学习
2023-01-27 v1
摘要
解释机器学习模型颇具挑战,但对保障自动驾驶系统中深度网络的安全至关重要。鉴于基于深度学习的感知模型在自动驾驶车辆中的普及,准确解释其预测十分关键。尽管已有多种此类方法被提出,大多被证明缺乏鲁棒性。然而,为可解释性鲁棒性提供认证的工作寥寥无几。朝此方向迈出一步,我们提出 CORGI,即可证明可解释性映射鲁棒性保证(Certifiably prOvable Robustness Guarantees for Interpretability mapping)的简称。CORGI 是一种接收输入图像并给出其 CAM 可解释性映射前 k 个像素鲁棒性的可认证下界的算法。我们通过交通标志数据上的案例研究展示 CORGI 的有效性,为最小对抗扰动认证下界,该下界与最先进攻击方法差距不大(4-5倍)。
引用
@article{arxiv.2301.11324,
title = {Certified Interpretability Robustness for Class Activation Mapping},
author = {Alex Gu and Tsui-Wei Weng and Pin-Yu Chen and Sijia Liu and Luca Daniel},
journal= {arXiv preprint arXiv:2301.11324},
year = {2023}
}
备注
13 pages, 5 figures. Accepted to Machine Learning for Autonomous Driving Workshop at NeurIPS 2020