利用标签层次对噪声关系分类数据进行预算敏感的重标注
计算与语言
2021-12-28 v1 人工智能
摘要
大型众包数据集通常含有噪声,关系分类(RC)数据集也不例外。重新标注整个数据集是一种可能的解决方案,但由于时间和预算限制,这并不总是可行的。本文解决了高效重标注大型噪声 RC 数据集的问题。我们的目标是在重标注更少实例的同时捕获数据集中更多的标注错误。现有的 RC 数据集重标注工作缺乏关于重标注多少数据的灵活性。我们引入重标注预算的概念来克服这一限制。紧接着的问题是:给定特定的重标注预算,我们应重标注数据的哪个子集?为了解决这个问题,我们提出了两种选择性重标注 RC 数据集的策略。我们的策略利用了关系标签的分类层次结构。我们工作的直觉是依赖于标签层次图中实际与预测关系标签之间的图距离。我们在著名的 TACRED 数据集上评估了我们的重标注策略。我们设计实验以回答三个具体的研究问题。第一,我们的策略是否选择了新的重标注候选?第二,对于给定的重标注预算,我们的重标注策略在捕获标注错误方面是否更高效?第三,数据重标注对 RC 模型性能度量的影响是什么?实验结果表明我们的两种重标注策略都是新颖且高效的。我们的分析表明,当前在噪声 TACRED 数据上报告的 RC 模型性能被夸大了。
引用
@article{arxiv.2112.13320,
title = {Budget Sensitive Reannotation of Noisy Relation Classification Data Using Label Hierarchy},
author = {Akshay Parekh and Ashish Anand and Amit Awekar},
journal= {arXiv preprint arXiv:2112.13320},
year = {2021}
}