中文

失校准的两面:面向网络校准识别过度与欠自信预测

机器学习 2023-08-08 v1 人工智能

摘要

深度神经网络恰当的置信度校准对于安全关键任务中的可靠预测至关重要。失校准可导致模型过度自信和/或欠自信;即模型对其预测的置信度可能高于或低于模型的准确率。近期研究通过引入校准技术强调了过度自信问题,并在多种任务上展示了成功。然而,通过欠自信产生的失校准尚未受到太多关注。在本文中,我们阐述了关注欠自信问题的必要性。我们首先引入一种新度量,即失校准分数,以识别整体与类别级的校准状态,包括过度或欠自信。我们提出的度量揭示了现有校准技术的缺陷,它们常过度校准模型并恶化欠自信预测。随后我们利用类别级失校准分数作为代理来设计一种可同时应对过度与欠自信的校准技术。我们报告了广泛的实验,表明我们提出的方法大幅优于现有校准技术。我们还在自动失败检测任务上用风险-覆盖曲线验证了所提校准技术,报告我们的方法改善了失败检测以及模型的可信度。代码可在 \url{https://github.com/AoShuang92/miscalibration_TS} 获取。

关键词

引用

@article{arxiv.2308.03172,
  title  = {Two Sides of Miscalibration: Identifying Over and Under-Confidence Prediction for Network Calibration},
  author = {Shuang Ao and Stefan Rueger and Advaith Siddharthan},
  journal= {arXiv preprint arXiv:2308.03172},
  year   = {2023}
}

备注

9 pages