PhenoLIP:将表型本体知识集成到医学视觉语言预训练中
计算机视觉与模式识别
2026-02-09 v1 计算与语言
摘要
最近的大规模类CLIP视觉语言模型(VLM)的进展极大推动了医学图像分析。然而,大多数现有医学VLM仍依赖粗糙的图像-文本对比目标,未能捕捉编码于 well-defined 医学表型本体中的系统性视觉知识。为解决这一问题,我们构建了 PhenoKG,首个大规模、以表型为中心的多模态知识图谱,包含超过52万个高质量的图像-文本对,链接到更多3000个表型。基于PhenoKG,我们提出了PhenoLIP,一种通过两个阶段显式整合结构化表型知识到医学VLM中的新型预训练框架。我们首先从文本本体数据中学习知识增强的表型嵌入空间,然后通过教师引导的知识蒸馏目标将这种结构化知识蒸馏到多模态预训练中。为支持评估,我们进一步引入了PhenoBench,一个经专家验证的基准测试,用于表型识别,包含超过7800个图像-标题对,覆盖超过1000个表型。大量实验表明,PhenoLIP超过了之前的SOTA基线,在表型分类准确率上提升了8.85%,在跨模态检索中提升了15.03%,凸显了将表型中心的先验知识整合到医学VLM中以实现结构化和可解释医学图像理解的价值。
引用
@article{arxiv.2602.06184,
title = {PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining},
author = {Cheng Liang and Chaoyi Wu and Weike Zhao and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2602.06184},
year = {2026}
}