KBioXLM:一种知识锚定的生物医学多语言预训练语言模型
计算与语言
2023-11-21 v1
摘要
大多数生物医学预训练语言模型是单语的,无法处理日益增长的多语言需求。非英语领域语料乃至平行数据的稀缺,给训练多语言生物医学模型带来了重大障碍。由于知识构成领域特定语料的核心且可准确翻译为多种语言,我们提出了一种称为KBioXLM的模型,其采用知识锚定方法将多语言预训练模型XLM-R引入生物医学领域。我们通过将三种粒度知识对齐(实体、事实和段落级)融入单语语料,获得了生物医学多语言语料。随后我们设计三种相应训练任务(实体掩码、关系掩码和段落关系预测),并在XLM-R模型之上继续训练以增强其领域跨语言能力。为验证模型有效性,我们将多项任务的英文基准翻译为中文。实验结果表明,我们的模型在跨语言零样本和少样本场景下显著优于单语与多语言预训练模型,提升达10余分。我们的代码公开于 https://github.com/ngwlh-gl/KBioXLM。
引用
@article{arxiv.2311.11564,
title = {KBioXLM: A Knowledge-anchored Biomedical Multilingual Pretrained Language Model},
author = {Lei Geng and Xu Yan and Ziqiang Cao and Juntao Li and Wenjie Li and Sujian Li and Xinjie Zhou and Yang Yang and Jun Zhang},
journal= {arXiv preprint arXiv:2311.11564},
year = {2023}
}