中文

Re-TACRED:解决 TACRED 数据集的缺陷

计算与语言 2021-04-20 v1

摘要

TACRED 是最大且应用最广的句级关系抽取数据集之一。基于该数据集评估的已有模型不断刷新最优性能。然而,尽管利用了外部知识及在大型文本语料上的无监督预训练,它们仍表现出较高的错误率。近期一项研究指出,这或许源于数据集质量不佳。该研究发现,开发集和测试集中最具挑战性的句子有超过 50% 被错误标注,并导致模型性能平均下降 8% 的 f1-score。但该研究所用仅为 5k(总计 106k)句子的有偏小样本,极大限制了结论的泛化性与广泛意义。本文通过以下方式解决这些缺陷:(i)对完整 TACRED 数据集开展全面研究;(ii)提出一种改进的众包策略并用于重新标注整个数据集;(iii)进行透彻分析以理解修正 TACRED 标注如何影响已发表结果。经核验,我们发现 23.9% 的 TACRED 标签不正确。此外,在修订数据集上评估多个模型使平均 f1-score 提升 14.3%,并有助于揭示不同模型间的重要关系(而非仅以常数因子偏移或缩放其分数)。最后,除分析外,我们还发布了 Re-TACRED——一个完全重新标注的 TACRED 数据集版本,可用于关系抽取模型的可靠评估。

关键词

引用

@article{arxiv.2104.08398,
  title  = {Re-TACRED: Addressing Shortcomings of the TACRED Dataset},
  author = {George Stoica and Emmanouil Antonios Platanios and Barnabás Póczos},
  journal= {arXiv preprint arXiv:2104.08398},
  year   = {2021}
}