中文

LinkBERT:利用文档链接预训练语言模型

计算与语言 2022-03-31 v1 机器学习

摘要

语言模型(LM)预训练可从文本语料库中学习各种知识,助力下游任务。然而,现有方法如BERT对单个文档建模,未捕获跨文档的依赖或知识。本工作中,我们提出LinkBERT,一种利用文档间链接(例如超链接)的LM预训练方法。给定文本语料库,我们将其视为文档图,并通过将链接文档置于同一上下文中创建LM输入。然后我们用两个联合自监督目标预训练LM:掩码语言建模和我们新提出的文档关系预测。我们展示LinkBERT在两个领域的各种下游任务上优于BERT:通用领域(在带超链接的Wikipedia上预训练)和生物医学领域(在带引用链接的PubMed上预训练)。LinkBERT对多跳推理和少样本QA尤其有效(HotpotQA和TriviaQA上绝对提升+5%),且我们的生物医学LinkBERT在各种BioNLP任务上刷新最优性能(BioASQ和USMLE上+7%)。我们在https://github.com/michiyasunaga/LinkBERT发布预训练模型LinkBERT和BioLinkBERT,以及代码和数据。

关键词

引用

@article{arxiv.2203.15827,
  title  = {LinkBERT: Pretraining Language Models with Document Links},
  author = {Michihiro Yasunaga and Jure Leskovec and Percy Liang},
  journal= {arXiv preprint arXiv:2203.15827},
  year   = {2022}
}

备注

Published at ACL 2022. Code, data, and pretrained models are available at https://github.com/michiyasunaga/LinkBERT