AI 中的信任:可解释性非必要亦非充分,而黑盒交互是必要且充分的
机器学习
2022-02-14 v1 人工智能
摘要
人类对人工智能的信任问题是应用机器学习中最基本的问题之一。我们评估 AI 可信度的流程对机器学习在科学、健康和人类领域的影响具有实质性的意义,然而围绕基础概念仍存在混淆。信任一个 AI 意味着什么?人类如何评估 AI 的可信度?构建可信 AI 的机制是什么?可解释机器学习在信任中扮演什么角色?在此,我们借鉴统计学习理论和关于人机自动化信任的社会学视角,提出了一个 AI 即工具的框架,将人机信任与人类-AI-人类信任区分开来。评估 AI 的契约可信度涉及使用行为证书 预测未来的模型行为,这些证书汇总了来自多种来源的行为证据,包括经验性的分布外和任务外评估,以及将模型架构与行为联系起来的理论证明。我们通过模型访问阶梯澄清了可解释性在信任中的作用。可解释性(第3级)对于信任不是必要的,甚至不是充分的,而能够随意运行黑盒模型(第2级)则是必要且充分的。虽然可解释性可以为信任带来益处,但也可能产生成本。我们澄清了可解释性有助于信任的方式,同时质疑了流行话语中可解释性对信任的核心地位。我们如何用工具赋能人们去评估信任?我们主张理解模型的行为,而不是试图理解模型是如何运作的。我们不应打开黑盒,而应创建更正确、更相关且更易懂的行为证书。我们讨论了如何负责任地构建受信任且可信的 AI。
引用
@article{arxiv.2202.05302,
title = {Trust in AI: Interpretability is not necessary or sufficient, while black-box interaction is necessary and sufficient},
author = {Max W. Shen},
journal= {arXiv preprint arXiv:2202.05302},
year = {2022}
}