利用模型置信度的反事实解释改进模型理解与信任
机器学习
2022-06-08 v1 人工智能
人机交互
摘要
在本文中,我们通过人类受试者研究证明,置信度分数的反事实解释有助于用户更好地理解和信任 AI 模型的预测。在人机交互系统中显示置信度分数有助于在人类与 AI 系统之间建立信任。然而,大多数现有研究仅将置信度分数作为一种沟通形式,我们仍然缺乏解释算法为何具有置信度的方法。本文还提出了两种利用反事实解释来理解模型置信度的方法:(1) 基于反事实样本;(2) 基于反事实空间的可视化。
引用
@article{arxiv.2206.02790,
title = {Improving Model Understanding and Trust with Counterfactual Explanations of Model Confidence},
author = {Thao Le and Tim Miller and Ronal Singh and Liz Sonenberg},
journal= {arXiv preprint arXiv:2206.02790},
year = {2022}
}
备注
8 pages, Accepted to IJCAI Workshop on Explainable Artificial Intelligence 2022