中文

WebRED:面向网页关系抽取的有效预训练与微调

计算与语言 2021-02-22 v1 信息检索

摘要

关系抽取用于填充对许多应用至关重要的知识库。先前用于训练关系抽取模型的数据集或因远程监督而存在标签噪声,或局限于特定领域,或规模过小而无法训练高容量模型。这限制了关系抽取的下游应用。因此我们引入:WebRED(Web Relation Extraction Dataset,网页关系抽取数据集),一个强监督人工标注的、用于从万维网上各类文本中抽取关系的数据集,包含约 110K 个样本。我们还描述了用于收集约 200M 个样本作为该任务预训练数据的方法。我们表明,在大型弱监督数据集上预训练与在小型强监督数据集上微调相结合可带来更好的关系抽取性能。我们为该新数据集提供基线,并论证人工标注对提升网页文本关系抽取性能的重要性。

关键词

引用

@article{arxiv.2102.09681,
  title  = {WebRED: Effective Pretraining And Finetuning For Relation Extraction On The Web},
  author = {Robert Ormandi and Mohammad Saleh and Erin Winter and Vinay Rao},
  journal= {arXiv preprint arXiv:2102.09681},
  year   = {2021}
}