中文

SelfMix:基于自混合训练的抗文本标签噪声鲁棒学习方法

计算与语言 2022-10-14 v2

摘要

文本分类的传统成功依赖于标注数据,而预训练语言模型(PLMs)这一新范式仍需要少量标注数据用于下游任务。然而,在真实应用中,标签噪声不可避免地存在于训练数据中,损害了基于此类数据构建的模型的有效性、鲁棒性和泛化能力。近来,在缓解视觉数据这一困境方面已取得显著成就,而探索文本数据的工作寥寥无几。为填补此空白,我们提出一种简单而有效的方法 SelfMix,用于处理文本分类任务中的标签噪声。SelfMix 使用高斯混合模型(Gaussian Mixture Model)对样本进行分离,并利用半监督学习。与以往需要多个模型的工作不同,我们的方法在单一模型上利用 dropout 机制以减少自训练中的确认偏差,并引入一种文本级 mixup 训练策略。在三个具有不同类型文本的文本内容分类基准上的实验结果表明,在不同噪声比例和噪声类型下,我们提出的方法性能优于为文本和视觉数据设计的这些强基线。我们的代码可在 https://github.com/noise-learning/SelfMix 获取。

关键词

引用

@article{arxiv.2210.04525,
  title  = {SelfMix: Robust Learning Against Textual Label Noise with Self-Mixup Training},
  author = {Dan Qiao and Chenchen Dai and Yuyang Ding and Juntao Li and Qiang Chen and Wenliang Chen and Min Zhang},
  journal= {arXiv preprint arXiv:2210.04525},
  year   = {2022}
}

备注

COLING-2022, oral presentation