面向自然语言理解数据增强的即时去噪
计算与语言
2024-02-01 v2 人工智能
摘要
数据增强(DA)常被用于自动提供额外的训练数据,而无需额外的人工标注。然而,数据增强可能会引入损害训练的噪声数据。为了保证增强数据的质量,现有方法要么假设增强数据中不存在噪声并采用一致性训练,要么使用训练损失和多样性约束等简单启发式方法来过滤掉“噪声”数据。然而,那些被过滤掉的样本可能仍包含有用信息,完全丢弃它们会导致监督信号的丢失。在本文中,基于原始数据集比增强数据更干净的假设,我们提出了一种用于数据增强的即时去噪技术,该技术从由在更干净的原始数据上训练的有机教师模型提供的软增强标签中进行学习。为了进一步防止对噪声标签的过拟合,我们应用了一个简单的自正则化模块,以强制模型预测在两种不同的 dropout 下保持一致。我们的方法可应用于通用增强技术,并在文本分类和问答任务上均能持续提升性能。
引用
@article{arxiv.2212.10558,
title = {On-the-fly Denoising for Data Augmentation in Natural Language Understanding},
author = {Tianqing Fang and Wenxuan Zhou and Fangyu Liu and Hongming Zhang and Yangqiu Song and Muhao Chen},
journal= {arXiv preprint arXiv:2212.10558},
year = {2024}
}
备注
Findings of EACL 2024