中文

BioLORD-2023:融合 LLM 与临床知识图洞察的语义文本表示

计算与语言 2023-11-28 v1 人工智能 信息检索

摘要

在本研究中,我们探究大型语言模型(LLM)在训练生物医学与临床领域语义模型时补充生物医学知识图表的潜力。借助 UMLS 知识图的丰富内容并利用前沿大型语言模型(LLM),我们提出了一种获取生物医学概念与句子高保真表示的新最优方法,包含三个阶段:改进的对比学习阶段、新颖的自蒸馏阶段和权重平均阶段。通过 BioLORD 测试套件和多样化下游任务的严格评估,我们展示了相较先前最优(state-of-the-art)的一致且显著的性能提升(例如在 MedSTS 上 +2 分、MedNLI-S 上 +2.5 分、EHR-Rel-B 上 +6.1 分)。除我们新的英语最优生物医学模型外,我们还蒸馏并发布了一个兼容 50 多种语言且微调于 7 种欧洲语言的多语言模型。许多临床流水线可受益于我们的最新模型。我们的新多语言模型使一系列语言能从我们在生物医学语义表示学习上的进展获益,为全球生物信息学研究者开辟新途径。因此,我们希望看到 BioLORD-2023 成为未来生物医学应用的宝贵工具。

关键词

引用

@article{arxiv.2311.16075,
  title  = {BioLORD-2023: Semantic Textual Representations Fusing LLM and Clinical Knowledge Graph Insights},
  author = {François Remy and Kris Demuynck and Thomas Demeester},
  journal= {arXiv preprint arXiv:2311.16075},
  year   = {2023}
}

备注

Preprint of upcoming journal article