中文

Evi-Steer:通过高效和通用的证据调控学习生物医学视觉语言模型

计算机视觉与模式识别 2026-05-27 v1 计算与语言

摘要

参数高效适应视觉语言基础模型对于精确的多模态生物医学图像理解至关重要,但现有方法是确定性的,往往在域迁移或模糊的图像-文本对齐方面表现不佳。这种限制在临床环境中尤为关键,因为模型应在低数据场景和域迁移下保持稳健。我们提出Evi-Steer,一种用于BiomedCLIP的证据跨模态低维调控框架,实现基于不确定性的参数高效微调,仅更新0.11%的总模型参数。我们的方法在视觉和文本编码器中执行轻量级低维token更新,同时估计情感不确定性。这些不确定性估计更新门控残差,允许模型在证据薄弱时谨慎适应。进一步,我们引入基于Dempster-Shaite理论的跨模态置信度融合,使视觉适应能够基于文本置信度进行条件化,并抑制冲突或不确定的跨模态更新。我们在覆盖8个器官和8种影像模态的15个生物医学影像数据集上进行了全面评估,涵盖少样本学习和域泛化设置。Evi-Steer在少样本学习和域迁移设置下持续优于最新方法,展示了在实际临床环境中部署视觉语言模型的实用且稳健的路径。代码已公开于 https://github.com/HealthX-Lab/Evi-Steer。

关键词

引用

@article{arxiv.2605.26292,
  title  = {Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning},
  author = {Taha Koleilat and Hassan Rivaz and Yiming Xiao},
  journal= {arXiv preprint arXiv:2605.26292},
  year   = {2026}
}

备注

MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer