通过元重写对比学习降低数据增强噪声并利用增强文本分类
计算与语言
2024-09-27 v1 机器学习
摘要
数据增强在解决数据匮乏问题和提高模型泛化能力方面显示出其有效性。然而,增强数据的质量可能因数而异,尤其是与原始/原始数据相比。在文本分类任务中,针对增强数据/样本的深度学习模型性能,本文提出了一种新框架,该框架将元学习和对比学习技术作为设计的一部分,用于对增强样本进行重新加权,并根据其质量细化其特征表示。在框架的一部分中,我们提出了 novel 的权重依赖性入队和出队算法,以有效利用增强样本的权重/质量信息。通过实验,我们显示该框架可以合理地与现有的深度学习模型(如RoBERTa-base和Text-CNN)以及增强技术(如Wordnet和Easydata)合作,用于特定的监督学习任务。实验结果表明,与最佳基线方法相比,我们的框架在七个GLUE基准数据集上在Text-CNN编码器上实现平均提升1.6%,最高可达4.3%的绝对提升,在RoBERTa-base编码器上实现平均提升1.4%,最高可达4.4%的绝对提升。我们呈现了对框架设计的深入分析,揭示了网络组件的非平凡贡献。我们的代码已公开,以便更好的可重复性。
引用
@article{arxiv.2409.17474,
title = {Reducing and Exploiting Data Augmentation Noise through Meta Reweighting Contrastive Learning for Text Classification},
author = {Guanyi Mou and Yichuan Li and Kyumin Lee},
journal= {arXiv preprint arXiv:2409.17474},
year = {2024}
}
备注
IEEE BigData 2021