中文

事后验证与真值标签的易错性

计算与语言 2021-06-15 v1 人工智能 机器学习

摘要

分类器通常利用预标注数据集,其中模型通过在由人工标注标签构成的留出测试集上以预定义指标进行评估。这些评估中使用的指标依赖于定义良好的真值标签的可用性,且这些指标通常不允许不精确匹配。这些含噪的真值标签和严格的评估指标可能损害评估结果的有效性和现实性。在本文中,我们讨论这些担忧,并对实体链接 (EL) 任务进行系统的事后验证实验。与传统方法要求标注者提供自由形式标注不同,我们要求标注者在事实之后(即事后)验证标注的正确性。与预标注评估相比,最先进的 EL 模型在事后评估方法下表现极好。事后验证还允许对真值数据集进行验证。令人惊讶的是,我们发现 EL 模型的预测具有与真值相似或更高的验证率。我们以对这些发现的讨论以及对未来评估的建议作为总结。

关键词

引用

@article{arxiv.2106.07353,
  title  = {Posthoc Verification and the Fallibility of the Ground Truth},
  author = {Yifan Ding and Nicholas Botzer and Tim Weninger},
  journal= {arXiv preprint arXiv:2106.07353},
  year   = {2021}
}

备注

12 pages, 6 figures, 1 table