中文

人工评估至关重要:审视远程监督关系抽取的测试协议

计算与语言 2021-05-21 v1 机器学习

摘要

远程监督(DS)关系抽取(RE)因可利用大规模自动标注数据,近年来备受关注。然而其评估长期存在问题:以往工作要么采用成本高且不一致的方法人工检视模型预测的一小部分样本,要么直接在自动标注数据上测试模型——经我们核查,在流行的NYT10数据集中,这种方法在实体对层面产生了高达53%的错误标注。该问题不仅导致评估不准确,也使得我们难以把握DS-RE研究的现状与待改进之处。为以更可信的方式评估DS-RE模型,我们为NYT10和Wiki20两个DS-RE数据集构建了人工标注测试集,并全面评估了若干具竞争力的模型,尤其是最新的预训练模型。实验结果表明,人工评估可指示出与自动评估非常不同的结论,特别是一些意外发现,例如预训练模型虽能取得压倒性性能,但相较于先前方法更易受假阳性影响。我们希望人工测试集与新发现能助力未来的DS-RE研究。

关键词

引用

@article{arxiv.2105.09543,
  title  = {Manual Evaluation Matters: Reviewing Test Protocols of Distantly Supervised Relation Extraction},
  author = {Tianyu Gao and Xu Han and Keyue Qiu and Yuzhuo Bai and Zhiyu Xie and Yankai Lin and Zhiyuan Liu and Peng Li and Maosong Sun and Jie Zhou},
  journal= {arXiv preprint arXiv:2105.09543},
  year   = {2021}
}

备注

ACL 2021 Findings