中文

重新审视远程监督关系抽取中的负数据

计算与语言 2021-05-24 v1 人工智能

摘要

远程监督自动生成大量关系抽取训练样本。然而,它也带来两个主要问题:噪声标签与训练数据不平衡。以往工作更多关注减少错误标注的关系(假阳性),而很少探究由知识库不完整引起的缺失关系(假阴性)。此外,在以往的问题表述中,负标签数量压倒性地超过正标签。本文中,我们首先对负数据引起的上述挑战进行透彻分析。接着,我们将关系抽取问题表述为正未标记学习(positive unlabeled learning)任务,以缓解假阴性问题。第三,我们提出一种称为\textsc{ReRe}的流水线方法,先执行句子级关系检测再进行主体/客体抽取,以实现样本高效训练。实验结果表明,所提方法持续优于现有方法,即使在学习大量假阳性样本时仍保持优异性能。

关键词

引用

@article{arxiv.2105.10158,
  title  = {Revisiting the Negative Data of Distantly Supervised Relation Extraction},
  author = {Chenhao Xie and Jiaqing Liang and Jingping Liu and Chengsong Huang and Wenhao Huang and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2105.10158},
  year   = {2021}
}