BERT 对标签噪声是否鲁棒?文本分类中带噪标签学习研究
计算与语言
2022-04-21 v1
摘要
当人类标注者犯错或通过弱监督或远程监督生成数据时,训练数据中会出现错误标签。已有研究表明,需要复杂的噪声处理技术——通过对噪声实例进行建模、清理或过滤——来防止模型拟合该标签噪声。然而,我们在本工作中表明,对于使用 BERT 等现代 NLP 模型的文本分类任务,在多种噪声类型下,现有的噪声处理方法并不总是能改善其性能,甚至可能使其恶化,这表明需要进一步研究。我们还通过全面的分析支撑了我们的观察。
引用
@article{arxiv.2204.09371,
title = {Is BERT Robust to Label Noise? A Study on Learning with Noisy Labels in Text Classification},
author = {Dawei Zhu and Michael A. Hedderich and Fangzhou Zhai and David Ifeoluwa Adelani and Dietrich Klakow},
journal= {arXiv preprint arXiv:2204.09371},
year = {2022}
}
备注
Accepted at Workshop on Insights from Negative Results in NLP 2022 @ACL 2022