中文

“我如何欺骗你?”:通过误导性黑盒解释操纵用户信任

人工智能 2019-11-18 v1

摘要

随着机器学习黑盒在医疗和刑事司法等关键领域的部署日益增多,开发以人类可解释方式解释这些黑盒的技术受到了越来越多的重视。最近人们意识到,黑盒 ML 模型的高保真解释可能并不能准确反映黑盒中的偏差。因此,解释有可能误导人类用户去信任一个有问题的黑盒。在这项工作中,我们严格探讨了误导性解释的概念及其如何影响用户对黑盒模型的信任。更具体地说,我们提出了一个用于理解和生成误导性解释的新颖理论框架,并与领域专家开展了一项用户研究,以展示这些解释如何被用来误导用户。我们的工作是首个通过经验确立用户对已黑盒模型的信任可经由误导性解释被操纵的研究。

关键词

引用

@article{arxiv.1911.06473,
  title  = {"How do I fool you?": Manipulating User Trust via Misleading Black Box Explanations},
  author = {Himabindu Lakkaraju and Osbert Bastani},
  journal= {arXiv preprint arXiv:1911.06473},
  year   = {2019}
}