中文

数据损坏对低资源语言命名实体识别的影响

计算与语言 2023-11-28 v2 人工智能

摘要

数据可用性与质量是低资源语言自然语言处理中的主要挑战。特别是,与高资源语言相比,可用数据显著更少。这些数据也常常质量低下,充斥着错误、无效文本或不正确的标注。许多先前的工作聚焦于处理这些问题,或通过生成合成数据,或过滤掉数据集中低质量的部分。我们转而更深入地探究这些因素,通过系统性地度量数据数量与质量在低资源设定下对预训练语言模型性能的影响。我们的结果表明,拥有较少的完全标注句子显著优于拥有更多带缺失标签的句子;并且模型仅使用 10% 的训练数据即可表现得出奇地好。重要的是,这些结果在十种低资源语言、英语以及四种预训练模型上是一致的。

关键词

引用

@article{arxiv.2208.04568,
  title  = {The Impact of Data Corruption on Named Entity Recognition for Low-resourced Languages},
  author = {Manuel Fokam and Michael Beukman},
  journal= {arXiv preprint arXiv:2208.04568},
  year   = {2023}
}