面向自然对抗图像的可解释 AI
人工智能
2021-06-18 v1
摘要
对抗图像凸显了现代图像分类器对其训练集之外扰动的脆弱性。人类监督或可缓解此弱点,但这取决于人类是否足够理解 AI 以预测其可能出错之时。在先前工作中,我们发现人类倾向于假定 AI 的决策过程映射其自身。此处我们评估来自可解释 AI 的方法能否打破该假定,以帮助参与者预测 AI 对对抗图像与标准图像的分类。我们发现显著图与示例均有助于捕捉 AI 错误,但其效应不具叠加性,且显著图比示例更有效。
引用
@article{arxiv.2106.09106,
title = {Explainable AI for Natural Adversarial Images},
author = {Tomas Folke and ZhaoBin Li and Ravi B. Sojitra and Scott Cheng-Hsin Yang and Patrick Shafto},
journal= {arXiv preprint arXiv:2106.09106},
year = {2021}
}