面向演化生物医学知识图谱的模态感知持续学习:CMKL
机器学习
2026-05-12 v1 人工智能
摘要
生物医学知识图谱正变得越来越大、动态和多模态,由于高通量测序等生物技术的快速进步。机器学习模型可以推断以往未观察到的生物医学关系并表征这些图中的生物医学实体,但现有的知识图谱嵌入方法及其持续学习扩展要么假设图结构是静态的,要么未能利用多模态信息下的演化数据分布。它们还会对所有模型参数应用一致的正则化,忽略不同模态在图演化过程中可能 exhibit 不同的遗忘动力学。我们提出了持续多模态知识图谱学习器 (CMKL),一个针对生物医学知识图谱的持续学习框架,原生地对结构、文本和分子进行编码,通过 Mixture-of-Experts (MoE) 路由器进行融合,并通过标准 EWC 正则化和 K-均值多样性多模态回放缓冲区来保护先前学习的知识。我们在拥有 129K 实体的生物医学持续基准测试上评估了 CMKL,包含 10 个任务。在持续生物医学实体分类任务中,CMKL 的平均精确率 (AP) 达到 0.591,远高于最强结构基线的 0.370,提升了 60%,且在整个序列中几乎不忘记 (AF 0.008)。在持续关系预测任务中,CMKL 的 AP 达到 ,在随机噪声下匹配 Naive Sequential 和 EWC (0.058),并在统计上优于 Joint Training (0.047, p=0.045) 和 LKGE (0.039)。一个冻结文本的消除实验达到 AP 0.136,超过所有联合训练模型的 2 倍,但该信号无法通过边际排名梯度到达:贪心模态非对称性体现在表示层面,而非融合层面,MoE 路由通过抑制不可到达的模态来实现这一点,而无需通过学习瓶颈强制它。
引用
@article{arxiv.2605.10510,
title = {CMKL: Modality-Aware Continual Learning for Evolving Biomedical Knowledge Graphs},
author = {Yousef A. Radwan and Yao Li and Qing Qing and Ziqi Xu and Qixin Zhang and Yongcheng Jing and Renqiang Luo and Xikun Zhang},
journal= {arXiv preprint arXiv:2605.10510},
year = {2026}
}