从上下文还是从名称学习?神经关系抽取的实证研究
计算与语言
2020-12-02 v2
摘要
神经模型在关系抽取(RE)基准上取得了显著成功。然而,目前尚不清楚哪类信息影响了现有RE模型做出决策,以及如何进一步提升这些模型的性能。为此,我们实证研究了文本中两类主要信息源的影响:文本上下文与实体提及(名称)。我们发现(i)尽管上下文是支撑预测的主要来源,RE模型也严重依赖来自实体提及的信息,其中大多为类型信息;(ii)现有数据集可能通过实体提及泄露浅层启发式规则,从而促成RE基准上的高表现。基于上述分析,我们提出了一种用于RE的实体掩码对比预训练框架,以加深对文本上下文与类型信息的理解,同时避免死记实体或利用提及中的表面线索。我们进行了大量实验以支持我们的观点,并表明该框架能提升神经模型在不同RE场景下的有效性与鲁棒性。所有代码与数据集发布于 https://github.com/thunlp/RE-Context-or-Names。
引用
@article{arxiv.2010.01923,
title = {Learning from Context or Names? An Empirical Study on Neural Relation Extraction},
author = {Hao Peng and Tianyu Gao and Xu Han and Yankai Lin and Peng Li and Zhiyuan Liu and Maosong Sun and Jie Zhou},
journal= {arXiv preprint arXiv:2010.01923},
year = {2020}
}
备注
Accepted by EMNLP 2020