中文

通过自教在线元损失重缩放从噪声标签中学习

计算与语言 2024-12-18 v1

摘要

正确的标签对于训练有效的机器学习模型不可或缺。然而,创建高质量标签成本高昂,即使专业标注的数据也包含错误和歧义。可以在训练前通过过滤和去噪来整理标注数据,但这会带来额外的处理和信息损失。另一种方法是在训练过程中进行在线样本重加权,以减少错误或歧义标签的负面影响,但这通常需要干净的种子数据。在这项工作中,我们提出了无监督的在线元损失重缩放来重新加权训练样本。关键的是,我们仅依赖被训练模型提供的特征,在不知道真实干净数据分布的情况下实时学习重缩放函数。我们通过一种新颖的元学习设置实现了这一点,该设置直接使用正在训练的重缩放函数从噪声训练语料库中采样验证数据用于元更新。我们提出的方法在各种自然语言处理任务中持续提升了性能,且计算开销极小。此外,我们是首批在对话建模这一具有挑战性的任务上尝试在线训练数据重加权的团队之一,该任务中噪声和歧义标签很常见。我们的策略在面对噪声和干净数据时具有鲁棒性,能处理类别不平衡,并防止过拟合噪声标签。我们的自教损失重缩放随着模型训练而改善,显示出从模型自身信号中持续学习的能力。随着训练的进行,正确标注数据的影响被放大,而错误标注数据的影响被抑制。

关键词

引用

@article{arxiv.2412.12955,
  title  = {Learning from Noisy Labels via Self-Taught On-the-Fly Meta Loss Rescaling},
  author = {Michael Heck and Christian Geishauser and Nurul Lubis and Carel van Niekerk and Shutong Feng and Hsien-Chin Lin and Benjamin Matthias Ruppik and Renato Vukovic and Milica Gašić},
  journal= {arXiv preprint arXiv:2412.12955},
  year   = {2024}
}

备注

10 pages, 3 figures, accepted at AAAI'25