中文

BALI:通过知识图谱与语言模型对齐增强生物医学语言表征

计算与语言 2025-09-10 v1 人工智能

摘要

近年来,使用预训练语言模型(LM)在旨在改善生物医学文本理解的一系列任务上取得了实质性进展。尽管如此,现有的生物医学大语言模型(LLM)对复杂的、领域特定的概念结构以及生物医学知识图谱(KG)中编码的事实信息理解有限。在这项工作中,我们提出了 BALI(生物医学知识图谱与语言模型对齐),这是一种新颖的联合 LM 和 KG 预训练方法,通过同时学习一个专用的 KG 编码器并对齐 LM 和图谱的表征,用外部知识增强 LM。对于给定的文本序列,我们将生物医学概念提及链接到统一医学语言系统(UMLS)知识图谱,并利用局部 KG 子图作为这些提及的跨模态正样本。我们的实证结果表明,在几个领先的生物医学 LM(如 PubMedBERT 和 BioLinkBERT)上实施我们的方法,即使仅在来自 PubMed 科学摘要的小型对齐数据集上进行少量预训练,也能提升它们在多种语言理解任务上的性能以及实体表征的质量。

关键词

引用

@article{arxiv.2509.07588,
  title  = {BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment},
  author = {Andrey Sakhovskiy and Elena Tutubalina},
  journal= {arXiv preprint arXiv:2509.07588},
  year   = {2025}
}

备注

9 pages, 1 figure, published in "The 48th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)"