用于评估 DNN 预测的可信度评分
机器学习
2023-08-31 v6
摘要
由于深度神经网络(DNN)的黑箱性质,在没有人类监控的情况下,运行期间对 DNN 的持续验证具有挑战性。这使得开发者和监管者难以对采用 DNN 的自主系统的部署建立信心。在运行期间,知晓 DNN 的预测何时可信或可疑对安全性至关重要。在缺乏人类监控的情况下,基本方法是使用模型的输出置信度评分来评估预测是可信还是可疑。然而,模型的置信度评分来自黑箱的计算结果,因此缺乏透明度,难以自动地将可信度归于预测。我们引入了可信度评分(TS),一种简单的度量,相比模型置信度评分,提供了更透明且有效的对 DNN 预测置信度的方式。该度量通过检查 DNN 所作预测中是否存在某些特征来量化预测的可信度。我们还利用 TS 度量的基本思想,在整个输入帧上提供可疑度评分(SS),以帮助检测存在假阴性的可疑帧。我们使用 YOLOv5 进行行人检测的案例研究来展示我们的方法及 TS 和 SS 的使用。案例研究表明,与仅依赖模型置信度评分相比,使用我们的方法在以下两方面一致地提高了预测的精度:1)可信预测的批准(约 20% 的提升)和 2)可疑帧的检测(约 5% 的提升)。
引用
@article{arxiv.2301.08839,
title = {A Trustworthiness Score to Evaluate DNN Predictions},
author = {Abanoub Ghobrial and Darryl Hond and Hamid Asgari and Kerstin Eder},
journal= {arXiv preprint arXiv:2301.08839},
year = {2023}
}