重访 TACRED:对 TACRED 关系抽取任务的深入评估
计算与语言
2020-05-01 v1
摘要
TACRED(Zhang et al., 2017)是关系抽取(RE)领域最大、使用最广泛的众包数据集之一。但即便在无监督预训练与知识增强神经 RE 取得近期进展的情况下,模型仍表现出较高的错误率。在本文中,我们探究以下问题:我们是否已触及性能天花板,还是仍有改进空间?以及众包标注、数据集与模型各自对该错误率的贡献如何?为回答这些问题,我们首先使用受训标注员对开发与测试集中最具挑战性的 5K 样本进行校验。我们发现标签错误占测试 F1 绝对误差的 8%,且超过 50% 的样本需要重新标注。在重新标注的测试集上,一组大型基线模型的平均 F1 分数从 62.1 提升至 70.1。校验之后,我们分析挑战性样本上的误分类,将其归为具有语言学动机的错误类别,并在三个最先进的 RE 模型上验证了由此得出的错误假设。我们表明,两类歧义关系造成了其余大部分错误,且当实体未被掩码时,模型可能在数据集上采用浅层启发式规则。
引用
@article{arxiv.2004.14855,
title = {TACRED Revisited: A Thorough Evaluation of the TACRED Relation Extraction Task},
author = {Christoph Alt and Aleksandra Gabryszak and Leonhard Hennig},
journal= {arXiv preprint arXiv:2004.14855},
year = {2020}
}
备注
Accepted at ACL 2020