中文

基于图注意力上下文增强的医学视觉语言模型参数高效适配——ACE-LoRA

计算机视觉与模式识别 2026-03-19 v1

摘要

CLIP类视觉语言模型(VLM)在自然图像上的成功已激发了医学领域的对应发展,但现有方法大致存在两种极端:一种是针对单一域数据训练的专家模型,能够捕捉域内细节但泛化性差;另一种是基于多域数据训练的通用医学VLM,能够保持广义语义但会稀释细粒度诊断线索。在专家-通用性之间的权衡仍具挑战性。为此,我们提出ACE-LoRA,一种用于通用医学VLM的参数高效适配框架,能够保持稳健的零样本泛化能力。ACE-LoRA将低秩适应(LoRA)模块集成到冻结的图像-文本编码器中,并引入基于注意力的上下文增强超图神经网络(ACE-HGNN)模块,以捕捉超越二元相似性的高阶上下文互动,利用局部诊断线索丰富全局表征,缓解了先前参数高效微调(PEFT)方法忽视细粒度细节的局限性。为进一步增强跨模态对齐,我们提出基于标签引导的InfoNCE损失,以有效抑制语义相关的图像-文本对之间的假负样本。尽管仅增加 0.95 万个可训练参数,ACE-LoRA在跨多个领域的零样本分类、分割和检测基准测试中 consistently 优于最先进的医学VLM和PEFT基线。我们的代码已公开于https://github.com/icon-lab/ACE-LoRA。

关键词

引用

@article{arxiv.2603.17079,
  title  = {ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models},
  author = {M. Arda Aydın and Melih B. Yilmaz and Aykut Koç and Tolga Çukur},
  journal= {arXiv preprint arXiv:2603.17079},
  year   = {2026}
}