中文

论数据集质量与异质性在模型置信度中的作用

机器学习 2020-02-25 v1 机器学习

摘要

安全关键应用要求机器学习模型输出准确且经过校准的概率。尽管未校准的深度网络会做出过度自信的预测已为人知,但模型置信度如何受数据中变化(如标签噪声或类别规模)的影响仍不明确。本文通过研究数据集规模与标签噪声对模型置信度的影响,考察数据集质量的作用。我们从理论上解释并实验证明:令人惊讶的是,训练数据中的标签噪声导致欠自信网络,而减小的数据集规模导致过自信模型。我们随后研究数据集异质性(即各类别间数据质量不同)对模型置信度的影响。我们证明这导致测试数据中异质的置信度/准确率行为,且标准校准算法难以妥善处理。为克服此问题,我们提出一种直观的异质校准技术,并表明所提方法在 CIFAR 数据集上改善了校准指标(平均与最坏情形误差)。

关键词

引用

@article{arxiv.2002.09831,
  title  = {On the Role of Dataset Quality and Heterogeneity in Model Confidence},
  author = {Yuan Zhao and Jiasi Chen and Samet Oymak},
  journal= {arXiv preprint arXiv:2002.09831},
  year   = {2020}
}

备注

25 pages, 14 figures