中文

SubRegWeigh:基于子词正则化的高效注释加权方法

计算与语言 2025-02-04 v2

摘要

NLP 数据集即使经过手动注释,仍可能包含注释错误。研究人员已尝试开发方法自动减少数据集错误的不良影响。然而,现有方法耗时,因为需要许多训练模型来检测错误。本文提出一种节省时间的方法,利用称为子词正则化的分词技术来模拟多个错误检测模型用于检测错误。我们提出的方法 SubRegWeigh 相对于现有方法在注释加权方面快 4 至 5 倍。此外,SubRegWeigh 在文档分类和命名实体识别任务中提升了性能。在伪错误标签实验中,SubRegWeigh 清晰地识别出伪错误标签作为注释错误。我们的代码已发布于 https://github.com/4ldk/SubRegWeigh。

关键词

引用

@article{arxiv.2409.06216,
  title  = {SubRegWeigh: Effective and Efficient Annotation Weighing with Subword Regularization},
  author = {Kohei Tsuji and Tatsuya Hiraoka and Yuchang Cheng and Tomoya Iwakura},
  journal= {arXiv preprint arXiv:2409.06216},
  year   = {2025}
}

备注

14 pages, 2 figures, 10 tables