中文

BERT 对标签噪声是否鲁棒?文本分类中带噪标签学习研究

计算与语言 2022-04-21 v1

摘要

当人类标注者犯错或通过弱监督或远程监督生成数据时,训练数据中会出现错误标签。已有研究表明,需要复杂的噪声处理技术——通过对噪声实例进行建模、清理或过滤——来防止模型拟合该标签噪声。然而,我们在本工作中表明,对于使用 BERT 等现代 NLP 模型的文本分类任务,在多种噪声类型下,现有的噪声处理方法并不总是能改善其性能,甚至可能使其恶化,这表明需要进一步研究。我们还通过全面的分析支撑了我们的观察。

关键词

引用

@article{arxiv.2204.09371,
  title  = {Is BERT Robust to Label Noise? A Study on Learning with Noisy Labels in Text Classification},
  author = {Dawei Zhu and Michael A. Hedderich and Fangzhou Zhai and David Ifeoluwa Adelani and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2204.09371},
  year   = {2022}
}

备注

Accepted at Workshop on Insights from Negative Results in NLP 2022 @ACL 2022