PrimeKG-CL:基于演化生物医学知识图谱的持续图学习基准
摘要
生物医学知识图谱为药物靶向治疗和临床决策支持提供了支撑,然而它们所依赖的上游本体论是在独立周期内更新的,每次更新会添加数百万条边,同时弃用数十万条旧边。然而现有的持续图学习研究几乎全部基于静态、通用知识图谱的合成随机划分,无法复现生物医学知识图谱所经历的异步、结构化演化。为此,我们引入了 PrimeKG-CL,这是一个来自九个权威生物医学数据库(129K+ 节点,8.1M+ 边,10 种节点类型,30 种关系类型)构建的 CGL 基准,包含两个真实的时间序列快照(2021 年 6 月、2023 年 7 月;新增 583 万条边,删除 88.9 万条,保持 721 万条),10 组实体类型分组任务,多模态节点特征,以及按任务划分的持久/新增/删除测试基准。我们在三个任务(生物医学关系预测、实体分类、KGQA)上评估了六种持续学习策略,涵盖四种 KGE 解码器,另外包括 LKGE、一个基于 LLM-RAG 的代理,以及 CMKL。我们发现解码器选择和持续学习策略之间存在强烈相互作用:没有单一策略在所有解码器上都表现最佳,甚至不匹配的组合组合会显著降低性能。此外,只有 DistMult 能清晰区分持久知识与已弃用知识,表明标准指标会将仍然有效的事实保存与忘记过时事实的失败混为一谈;在 RotatE 下则不存在此现象。此外,多模态特征可使实体级任务提升最高 60%,而最近的 CKGE 框架(IncDE)未能在 5.67 百万三元组的基准任务上扩展,尽管尝试了五次,最高内存占用达 350GB。我们公开发布了数据、管道、基线方法以及分层划分。数据集:https://huggingface.co/datasets/yradwan147/PrimeKGCL|代码:https://github.com/yradwan147/primekg-cl-neurips2026
引用
@article{arxiv.2605.10529,
title = {PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs},
author = {Yousef A. Radwan and Yao Li and Qing Qing and Ziqi Xu and Xingtong Yu and Jiaxing Huang and Renqiang Luo and Xikun Zhang},
journal= {arXiv preprint arXiv:2605.10529},
year = {2026}
}