运行期校准:调试深度神经网络在部署现场的置信度错误
机器学习
2020-09-16 v2 软件工程
机器学习
摘要
训练好的深度神经网络(DNN)模型正日益作为软件系统的组成部分被采用,但它们在现场往往表现不佳。一个尤其具有破坏性的问题是由于运行数据与训练数据之间不可避免的轻微偏差,DNN模型经常给出高置信度的错误预测。为了最小化不准确置信度带来的损失,运行期校准,即针对运行域校准DNN分类器的置信度函数,成为整个系统工程中的必要调试步骤。考虑到标注运行数据的预算有限以及DNN模型可解释性弱,运行期校准十分困难。我们提出了一种贝叶斯方法进行运行期校准,该方法利用从大量未标注运行数据中刻意挑选的少量标注运行数据,逐步修正被校准模型给出的置信度。通过利用DNN模型所学表示的局部性并将校准建模为高斯过程回归(Gaussian Process Regression),该方法实现了高效与有效。基于多种实际数据集和DNN模型的综合实验表明,它显著优于替代方法,并且在某些困难任务中,仅使用实用学习技术勉强工作所需最少标注运行数据量的约10%,就消除了约71%至97%的高置信度(>0.9)错误。
引用
@article{arxiv.1910.02352,
title = {Operational Calibration: Debugging Confidence Errors for DNNs in the Field},
author = {Zenan Li and Xiaoxing Ma and Chang Xu and Jingwei Xu and Chun Cao and Jian Lü},
journal= {arXiv preprint arXiv:1910.02352},
year = {2020}
}
备注
Published in the Proceedings of the 28th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (ESEC/FSE 2020)