特征归因方法的有效性及其与自动评价指标的相关性
计算机视觉与模式识别
2022-07-25 v5 人工智能
人机交互
摘要
解释人工智能(AI)模型的决策在许多现实世界高风险应用中日益关键。已有数百篇论文提出新的特征归因方法,或在工作中讨论和利用这些工具。然而,尽管人类是目标终端用户,大多数归因方法仅在代理自动评价指标上进行了评估(Zhang et al. 2018; Zhou et al. 2016; Petsiuk et al. 2018)。本文开展了首项用户研究,以衡量归因图在辅助人类进行 ImageNet 分类和 Stanford Dogs 细粒度分类,以及图像为自然或对抗性(即含对抗扰动)时的有效性。总体而言,特征归因出人意料地并不比向人类展示最近训练集样本更有效。在细粒度狗分类这一更难的任务上,向人类呈现归因图无益,反而相比仅用 AI 损害了人机团队的表现。重要的是,我们发现自动归因图评价指标与实际人机团队表现相关性很差。我们的发现鼓励学界在其下游人在回路应用中严格测试方法,并重新思考现有评价指标。
引用
@article{arxiv.2105.14944,
title = {The effectiveness of feature attribution methods and its correlation with automatic evaluation scores},
author = {Giang Nguyen and Daeyoung Kim and Anh Nguyen},
journal= {arXiv preprint arXiv:2105.14944},
year = {2022}
}
备注
NeurIPS 2021; 10 pages of Main text; 28 pages of Appendix