停止端到端关系抽取中不正确的比较!
计算与语言
2021-08-10 v3 人工智能
机器学习
摘要
尽管已有工作致力于区分三种不同的评测设定(Bekoulis et al., 2018),众多端到端关系抽取(RE)文章仍给出与先前工作不可靠的性能比较。本文中,我们首先指出已发表论文中若干无效比较的模式并加以描述,以避免其传播。随后我们提出一项小型实证研究,量化最常见错误的影响,并评估其在 ACE05 上导致最终 RE 性能被高估约 5%。我们也借此机会研究两项近期进展中未被探索的消融实验:语言模型预训练(具体为 BERT)的使用与跨度级 NER。该元分析强调了在评测设定与数据集统计报告上保持严谨的必要性,并呼吁统一端到端 RE 的评测设定。
引用
@article{arxiv.2009.10684,
title = {Let's Stop Incorrect Comparisons in End-to-end Relation Extraction!},
author = {Bruno Taillé and Vincent Guigue and Geoffrey Scoutheeten and Patrick Gallinari},
journal= {arXiv preprint arXiv:2009.10684},
year = {2021}
}
备注
Accepted at EMNLP 2020