中文

将结构化生物医学知识注入语言模型:持续预训练 vs GraphRAG

计算与语言 2026-04-21 v1 人工智能 机器学习

摘要

将领域特定知识注入语言模型(LMs)对于适应生物医学等专业领域至关重要。虽然目前大多数方法依赖非结构化文本语料库,但本研究探讨了两种互补策略,用于利用UMLS Metathesaurus中的结构化知识:(i)持续预训练将知识嵌入模型参数中,(ii)图检索增强生成(GraphRAG)在推理时查询知识图。我们首先构建了一个来自UMLS的大型生物医学知识图,包含340万概念和3420万关系,存储在Neo4j中以实现高效查询。随后,我们从该知识图中派生出约1亿token的文本语料库,用于持续预训练两个模型:BERTUMLS(基于BERT)和BioBERTUMLS(基于BioBERT)。我们在六个BLURB(Biomedical Language Understanding and Reasoning Benchmark)数据集上评估这些模型,涵盖五种任务类型,并评估GraphRAG在两个QA(问答)数据集(PubMedQA、BioASQ)上的表现。在BLURB任务上,BERTUMLS相较于BERT提升,其中在知识密集型QA任务上的提升最大。BioBERT的效果更为细致,表明当基础模型已编码大量生物医学文本知识时,存在收益递减。最后,通过将我们的GraphRAG管道增强LLaMA 3-8B,在PubMedQA上获得超过3个百分点的准确率提升,在BioASQ上获得超过5个百分点的提升,无需任何重新训练,实现了透明、多跳且易于更新的知识访问。我们发布了处理后的UMLS Neo4j图以支持可重复性。

关键词

引用

@article{arxiv.2604.16422,
  title  = {Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG},
  author = {Jaafer Klila and Sondes Bannour Souihi and Rahma Boujelben and Nasredine Semmar and Lamia Hadrich Belguith},
  journal= {arXiv preprint arXiv:2604.16422},
  year   = {2026}
}

备注

Accepted at LREC 2026