NoisywikiHow:一个用于自然语言处理中真实世界噪声标签学习的基准
计算与语言
2023-05-19 v1 人工智能
摘要
现实世界中的大规模数据集不可避免地包含标签噪声。深度模型会逐渐过拟合噪声标签,从而退化模型泛化能力。为减轻标签噪声的影响,带有噪声标签的学习(LNL)方法旨在获得更好的泛化性能。由于缺乏合适的数据集,以往研究常采用合成标签噪声来模拟真实世界标签噪声。然而,合成噪声并非实例依赖的,使得该近似在实践中并不总是有效。近期研究提出了用于真实世界噪声标签学习的基准。但其内部噪声来源可能单一或模糊,使基准不同于真实世界中具有异构标签噪声的数据。为解决这些问题,我们贡献了NoisywikiHow,这是以最小监督构建的最大NLP基准。具体而言,受人类认知启发,我们显式构建多源标签噪声以模仿标注过程中的人为错误,复现真实世界噪声,其污染受真实标签和实例共同影响。此外,我们提供多种噪声水平以支持对噪声数据的受控实验,使我们能系统而全面地评估LNL方法。之后,我们对广泛的LNL方法进行了多维度的广泛实验,获得了新颖且有趣的发现。
引用
@article{arxiv.2305.10709,
title = {NoisywikiHow: A Benchmark for Learning with Real-world Noisy Labels in Natural Language Processing},
author = {Tingting Wu and Xiao Ding and Minji Tang and Hao Zhang and Bing Qin and Ting Liu},
journal= {arXiv preprint arXiv:2305.10709},
year = {2023}
}
备注
The paper has been accepted by ACL 2023 Findings. Dataset and code are available in this https URL