中文

ActiveAED:人在回路提升标注错误检测

计算与语言 2023-06-01 v1 机器学习

摘要

人工标注数据集对于训练和评估自然语言处理模型至关重要。然而,近期研究发现,即便广泛使用的基准数据集也包含大量错误标注。该问题已通过标注错误检测(AED)模型加以解决,此类模型可标记此类错误以供人工重新标注。然而,尽管许多 AED 方法假设在最终筛选步骤中由人工标注者判定标注是否有误,它们却作为静态模型开发,不含任何人在回路组件。本文中,我们提出 ActiveAED,一种可通过在其预测回路中反复查询人工进行错误纠正从而更准确检测错误的 AED 方法。我们在涵盖五种不同任务的八个数据集上评估 ActiveAED,发现其在其中七个数据集上取得了优于当前最优方法的提升,平均精度最高提升六个百分点。

关键词

引用

@article{arxiv.2305.20045,
  title  = {ActiveAED: A Human in the Loop Improves Annotation Error Detection},
  author = {Leon Weber and Barbara Plank},
  journal= {arXiv preprint arXiv:2305.20045},
  year   = {2023}
}

备注

Findings of ACL 2023