中文

NERO:一种用于低标注资源关系抽取的神经规则接地框架

计算与语言 2020-01-17 v4

摘要

尽管深度神经模型在标注充足场景下取得了成功,但在完美标注数据有限时,其关系抽取的可靠性往往较低。与其向人类标注者寻求更多实例级标签,本文提出标注频繁表层模式以形成标注规则。这些规则可自动从大规模文本语料中挖掘,并通过软规则匹配机制进行泛化。先前工作以精确匹配方式使用标注规则,这本质上限制了句子匹配的覆盖率并导致低召回率问题。本文提出一种用于关系抽取(RE)规则接地的神经方法 NERO,其联合学习关系抽取模块与软匹配模块。任何神经关系抽取模型均可作为 RE 模块的实例化。软匹配模块学习将规则与语义相似句子进行匹配,从而除精确匹配的句子外,原始语料可被自动标注并以更高覆盖率作为增强监督被 RE 模块利用。在两个公开且广泛使用的数据集上的大量实验与分析证明了所提 NERO 框架相比基于规则和半监督方法的有效性。通过用户研究,我们发现人类标注规则和句子的耗时效率相近(每个标签 0.30 对比 0.35 分钟)。特别地,NERO 使用 270 条规则的性能可与使用 3,000 条标注句子训练的模型相媲美,实现了 9.5 倍的加速。此外,NERO 能在测试时预测未见关系并提供可解释的预测。我们向社区发布代码以供未来研究。

关键词

引用

@article{arxiv.1909.02177,
  title  = {NERO: A Neural Rule Grounding Framework for Label-Efficient Relation Extraction},
  author = {Wenxuan Zhou and Hongtao Lin and Bill Yuchen Lin and Ziqi Wang and Junyi Du and Leonardo Neves and Xiang Ren},
  journal= {arXiv preprint arXiv:1909.02177},
  year   = {2020}
}

备注

Accepted by WWW2020. Code available at https://github.com/INK-USC/NERO