MixUp训练可降低Transformer架构的过拟合并改善校准
计算与语言
2021-02-24 v1 机器学习
摘要
MixUp是一种计算机视觉数据增强技术,它利用输入数据及其标签的凸插值来增强训练期间的模型泛化能力。然而,由于难以在输入空间中直接对文本进行插值,MixUp在自然语言理解(NLU)领域的应用一直受到限制。在本研究中,我们针对Transformer架构提出了输入级、流形级和句子嵌入级的MixUp方法,并将其应用于微调BERT模型以处理多样化的NLU任务。我们发现,MixUp能够提升模型性能,并将测试损失和模型校准误差最多降低50%。
引用
@article{arxiv.2102.11402,
title = {MixUp Training Leads to Reduced Overfitting and Improved Calibration for the Transformer Architecture},
author = {Wancong Zhang and Ieshan Vaidya},
journal= {arXiv preprint arXiv:2102.11402},
year = {2021}
}