中文

面向自然对抗图像的可解释 AI

人工智能 2021-06-18 v1

摘要

对抗图像凸显了现代图像分类器对其训练集之外扰动的脆弱性。人类监督或可缓解此弱点,但这取决于人类是否足够理解 AI 以预测其可能出错之时。在先前工作中,我们发现人类倾向于假定 AI 的决策过程映射其自身。此处我们评估来自可解释 AI 的方法能否打破该假定,以帮助参与者预测 AI 对对抗图像与标准图像的分类。我们发现显著图与示例均有助于捕捉 AI 错误,但其效应不具叠加性,且显著图比示例更有效。

关键词

引用

@article{arxiv.2106.09106,
  title  = {Explainable AI for Natural Adversarial Images},
  author = {Tomas Folke and ZhaoBin Li and Ravi B. Sojitra and Scott Cheng-Hsin Yang and Patrick Shafto},
  journal= {arXiv preprint arXiv:2106.09106},
  year   = {2021}
}