面向句子分类任务的后验校准训练
计算与语言
2020-05-04 v2 机器学习
机器学习
摘要
大多数分类模型首先预测所有类别上的后验概率分布,然后选择估计概率最大的类别。然而在许多场景中,后验概率本身的质量(例如患糖尿病的 65% 几率)比仅最终预测的类别提供更可靠的信息。当这些方法被证明校准不良时,迄今为止大多数修正依赖于后验校准,其对预测概率进行重标度,但往往对最终分类影响甚微。在此我们提出一种称为后验校准 (PosCal) 训练的端到端训练过程,在最小化预测与经验后验概率之间差异的同时直接优化目标。我们表明 PosCal 不仅有助于减小校准误差,还通过惩罚两个目标上性能的下降来改善任务表现。与基线相比,我们的 PosCal 在 GLUE (Wang et al., 2018) 上实现了约 2.5% 的任务性能提升和 16.1% 的校准误差降低。我们在 xSLUE (Kang and Hovy, 2019) 上以 13.2% 的校准误差降低实现了相当的任务表现,但未超越两阶段校准基线。PosCal 训练可作为一种正则化项的形式轻易扩展到任何类型的分类任务。此外,PosCal 的优势在于它在训练过程中增量追踪校准目标所需的统计量,从而高效利用大型训练集。
引用
@article{arxiv.2004.14500,
title = {Posterior Calibrated Training on Sentence Classification Tasks},
author = {Taehee Jung and Dongyeop Kang and Hua Cheng and Lucas Mentch and Thomas Schaaf},
journal= {arXiv preprint arXiv:2004.14500},
year = {2020}
}
备注
Accepted at ACL 2020