中文

AlleNoise:大规模带有真实标签噪声的文本分类基准数据集

计算与语言 2024-10-24 v2 机器学习

摘要

标签噪声是训练稳健分类模型的挑战。大多数用于缓解标签噪声的方法是在主要使用带有合成噪声的数据集上进行基准测试的。虽然为具有真实噪声分布的数据集的需求已部分通过网页抓取基准(如WebVision和Clothing1M)得到缓解,但这些基准受限于计算机视觉领域。随着Transformer-based模型的重要性不断提升,建立用于学习带噪标签的文本分类基准显得尤为重要。本文我们提出AlleNoise,一个新的精选文本分类基准数据集,包含来自实际用户的实例依赖标签噪声,拥有超过50万个示例,涵盖约5,600个类别,并配有有意义的、层次化的类别分类学。噪声分布来自主要电子商务平台的用户,因此真实反映了人类错误的语义。在除噪标签外,我们提供人工验证的干净标签,这有助于深入了解噪声分布,不同于通常用于该领域的网页抓取数据集。我们展示了代表性挑选方法在处理此类真实噪声方面不足。此外,我们表明这些算法并不能缓解过度记忆。因此,随着AlleNoise,我们为能够处理文本分类任务中真实标签噪声的标签噪声方法的开发设定了高标准。代码和数据集可在https://github.com/allegro/AlleNoise下载。

关键词

引用

@article{arxiv.2407.10992,
  title  = {AlleNoise: large-scale text classification benchmark dataset with real-world label noise},
  author = {Alicja Rączkowska and Aleksandra Osowska-Kurczab and Jacek Szczerbiński and Kalina Jasinska-Kobus and Klaudia Nazarko},
  journal= {arXiv preprint arXiv:2407.10992},
  year   = {2024}
}