欺骗性 AI 解释:生成与检测
机器学习
2021-12-03 v3 人工智能
机器学习
摘要
人工智能(AI)带来巨大机遇,但也可能带来重大风险。针对决策的自动生成解释可提升透明度并增进信任,尤其对于基于 AI 模型自动预测的系统而言。然而,考虑到例如制造不诚实 AI 的经济动机,我们能在多大程度上信任这些解释?为解决这个问题,我们的工作研究了如何利用 AI 模型(即深度学习,以及现有的用于提升 AI 决策透明度的工具)来生成并检测欺骗性解释。作为实证评估,我们聚焦于文本分类,并改动由 GradCAM(一种成熟的神经网络解释技术)生成的解释。随后,我们在一个有 200 名参与者的实验中评估了欺骗性解释对用户的影响。我们的发现证实欺骗性解释确实能愚弄人类。然而,在具备充足领域知识的情况下,可部署机器学习(ML)方法以超过 80% 的准确率检测看似微小的欺骗企图。若无领域知识,在掌握所审视预测模型基本知识的前提下,仍可以无监督方式推断出解释中的不一致性。
引用
@article{arxiv.2001.07641,
title = {Deceptive AI Explanations: Creation and Detection},
author = {Johannes Schneider and Christian Meske and Michalis Vlachos},
journal= {arXiv preprint arXiv:2001.07641},
year = {2021}
}