一种基于数据制图学的预训练语言模型 MixUp 方法
计算与语言
2022-05-09 v1
摘要
MixUp 是一种数据增强策略,通过在训练期间组合随机训练样本对及其标签来生成额外样本。然而,选择随机样本对未必是最优选择。本工作中,我们提出 TDMixUp,一种利用训练动态(Training Dynamics)并允许组合更具信息量的样本以生成新数据的新型 MixUp 策略。我们提出的 TDMixUp 首先度量置信度、变异性(Swayamdipta et al., 2020)与边界下面积(AUM)(Pleiss et al., 2020)以辨识训练样本特征(例如易学样本或模糊样本),随后对这些已刻画样本进行插值。我们经实证验证,相较强基线,我们的方法不仅在使用更小训练子集时取得有竞争力的性能,而且在广泛 NLP 任务上于预训练语言模型 BERT 的域内与域外设定中均产生更低的期望校准误差。我们公开发布代码。
引用
@article{arxiv.2205.03403,
title = {A Data Cartography based MixUp for Pre-trained Language Models},
author = {Seo Yeon Park and Cornelia Caragea},
journal= {arXiv preprint arXiv:2205.03403},
year = {2022}
}
备注
Accepted at NAACL 2022 main conference. arXiv admin note: text overlap with arXiv:2203.07559