中文

CLEANANERCorp:识别并修正ANERcorp数据集中的错误标签

计算与语言 2025-03-11 v2

摘要

标签错误是机器学习数据集中的常见问题,尤其是在命名实体识别等任务中。此类标签错误可能损害模型训练、影响评估结果,并导致对模型性能的不准确评估。在本研究中,我们深入探究了广泛采用的阿拉伯语NER基准数据集之一(ANERcorp),发现了大量标注错误、缺失标签和不一致之处。因此,我们进行了实证研究以理解这些错误、修正它们,并提出了一个更清洁的数据集版本,命名为CLEANANERCorp。CLEANANERCorp将作为一个更准确、更一致的基准服务于研究社区。

关键词

引用

@article{arxiv.2408.12362,
  title  = {CLEANANERCorp: Identifying and Correcting Incorrect Labels in the ANERcorp Dataset},
  author = {Mashael Al-Duwais and Hend Al-Khalifa and Abdulmalik Al-Salman},
  journal= {arXiv preprint arXiv:2408.12362},
  year   = {2025}
}

备注

Proceedings of the 6th Workshop on Open-Source Arabic Corpora and Processing Tools (OSACT) with Shared Tasks on Arabic LLMs Hallucination and Dialect to MSA Machine Translation @ LREC-COLING 2024