中文

我们究竟能多信任你?面向深度神经网络简洁可解释的信任量化指标

机器学习 2021-04-06 v3 人工智能 计算机视觉与模式识别

摘要

构建可信深度神经网络的关键一步是信任量化,即我们提出这样的问题:我们能多信任一个深度神经网络?在本研究中,我们通过引入一套基于深度神经网络在回答一组问题时的行为来评估其整体可信度的指标,朝着简洁、可解释的信任量化指标迈出一步。我们进行思想实验并探讨关于信任与置信度关系的两个关键问题:1) 我们对以极大置信给出错误答案的行为者有多少信任?2) 我们对犹豫地给出正确答案的行为者有多少信任?基于所获见解,我们引入问题-答案信任的概念,以根据正确与错误答案情境下的置信行为量化单个答案的可信度,以及信任密度的概念以刻画单个答案情境下整体信任的分布。我们进一步引入信任谱的概念,以表示跨正确与错误回答问题的可能答案情境谱的整体信任。最后,我们引入 NetTrustScore,一个总结整体可信度的标量指标。该套指标与以往研究信任与置信度关系的社会心理学研究相一致。利用这些指标,我们量化了几种知名图像识别深度神经网络架构的可信度,以更深入理解信任在何处失效。所提指标绝非完美,但希望推动相关讨论朝向更好的指标发展,以帮助从业者和监管者生成、部署和认证可信任用于在现实世界关键任务场景中运行的深度学习解决方案。

关键词

引用

@article{arxiv.2009.05835,
  title  = {How Much Can We Really Trust You? Towards Simple, Interpretable Trust Quantification Metrics for Deep Neural Networks},
  author = {Alexander Wong and Xiao Yu Wang and Andrew Hryniowski},
  journal= {arXiv preprint arXiv:2009.05835},
  year   = {2021}
}

备注

13 pages