通过查询驱动专家桥接将基础视觉语言模型适配于医学诊断
计算机视觉与模式识别
2026-05-18 v3
摘要
视觉语言基础模型在自然图像分类中取得了令人鼓舞的性能,但将其直接应用于医学影像受限于严重的领域偏移、分辨率不匹配以及临床诊断的多标签特性。然而,从头开始训练专门的医学基础模型既昂贵又数据密集。在此,我们提出 MedBridge,一个轻量级适配框架,通过为医学图像诊断联合结合领域对齐、分辨率保持和多标签推理,利用互补的 VLM 专家,开辟了缓解领域差距的新方向。具体而言,MedBridge 将预训练的 VLM 转换为多视图查询编码器,将一组紧凑的可学习查询 token 注入中间层,在通过多视图高分辨率采样保留细粒度病理线索的同时,实现无损的领域对齐。这些查询 token 进一步作为混合专家模型的路由信号,无需共享表示空间即可动态集成异构基础模型以进行多标签推理。我们在三个关键适配任务中的五个胸部 X 光片基准上评估了 MedBridge。MedBridge 在跨领域泛化(分布外迁移)和领域内专业化(同分布微调)设置中均展现出卓越性能,与多标签胸部疾病诊断的最先进适配方法相比,AUC 显著提升了 6-15%。此外,MedBridge 与模型无关,并在八个不同的 VLM(例如,CLIP、LLaVA、Qwen-VL、MedGemma)中展示了广泛的扩展性,突显了其将任意基础模型灵活适配为强大医学诊断工具的能力。我们的代码将在被接受后发布。
引用
@article{arxiv.2505.21698,
title = {Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging},
author = {Yitong Li and Morteza Ghahremani and Christian Wachinger},
journal= {arXiv preprint arXiv:2505.21698},
year = {2026}
}