中文

基于边界下面积与显著性引导的 Mixup 对预训练语言模型的标定

计算与语言 2022-03-16 v1 机器学习

摘要

一个良好标定的神经模型所产生的置信度(概率输出)与期望准确率紧密近似。尽管先前研究表明,mixup 训练作为一种数据增强技术可改善图像分类任务上的模型标定,但关于将 mixup 用于自然语言理解(NLU)任务上的模型标定却知之甚少。在本文中,我们探索了在若干 NLU 任务上使用 mixup 进行模型标定,并提出了一种针对预训练语言模型的新型 mixup 策略,可进一步改善模型标定。我们提出的 mixup 由边界下面积(AUM)统计量(Pleiss 等,2020)和每个样本的显著性图(Simonyan 等,2013)共同引导。此外,我们将该 mixup 策略与模型未标定校正技术(即标签平滑和温度缩放)相结合,并详细分析了它们对我们所提 mixup 的影响。我们着重在三个 NLU 任务上系统性地设计实验:自然语言推理、释义检测和常识推理。我们的方法在域内和域外测试样本上相比强基线取得了最低期望标定误差,同时保持了有竞争力的准确率。

关键词

引用

@article{arxiv.2203.07559,
  title  = {On the Calibration of Pre-trained Language Models using Mixup Guided by Area Under the Margin and Saliency},
  author = {Seo Yeon Park and Cornelia Caragea},
  journal= {arXiv preprint arXiv:2203.07559},
  year   = {2022}
}

备注

Accepted at ACL 2022 main conference