LinkBERT:利用文档链接预训练语言模型
计算与语言
2022-03-31 v1 机器学习
摘要
语言模型(LM)预训练可从文本语料库中学习各种知识,助力下游任务。然而,现有方法如BERT对单个文档建模,未捕获跨文档的依赖或知识。本工作中,我们提出LinkBERT,一种利用文档间链接(例如超链接)的LM预训练方法。给定文本语料库,我们将其视为文档图,并通过将链接文档置于同一上下文中创建LM输入。然后我们用两个联合自监督目标预训练LM:掩码语言建模和我们新提出的文档关系预测。我们展示LinkBERT在两个领域的各种下游任务上优于BERT:通用领域(在带超链接的Wikipedia上预训练)和生物医学领域(在带引用链接的PubMed上预训练)。LinkBERT对多跳推理和少样本QA尤其有效(HotpotQA和TriviaQA上绝对提升+5%),且我们的生物医学LinkBERT在各种BioNLP任务上刷新最优性能(BioASQ和USMLE上+7%)。我们在https://github.com/michiyasunaga/LinkBERT发布预训练模型LinkBERT和BioLinkBERT,以及代码和数据。
引用
@article{arxiv.2203.15827,
title = {LinkBERT: Pretraining Language Models with Document Links},
author = {Michihiro Yasunaga and Jure Leskovec and Percy Liang},
journal= {arXiv preprint arXiv:2203.15827},
year = {2022}
}
备注
Published at ACL 2022. Code, data, and pretrained models are available at https://github.com/michiyasunaga/LinkBERT