中文

vMFCoOp:面向生物医学视觉语言模型的统一球面上衡平框架

计算机视觉与模式识别 2025-11-21 v3

摘要

近期大语言模型(LLM)提炼的医学语义先验指导下的情境优化(CoOp)为手动编写提示词和完全微调适配生物医学 CLIP 系列视觉语言模型(VLM)提供了可扩展的替代方案。然而,由于训练语料和模型架构的差异,LLM 与 CLIP 变体之间的语义错位为提示学习带来了挑战;且缺乏对持续演化的基础模型家族的可扩展性。更关键的是,传统欧几里得空间上的两两多模态对齐缺乏建模统一表征或施加局部几何约束的能力,这往往会放大复杂生物医学影像中的模态差距并 destabilize 少样本适应。在本工作中,我们提出 vMFCoOp 框架,通过逆向估计von Mises-Fisher(vMF)分布于共享球面流形上,将任意 LLM 与 CLIP 背骨之间的语义偏差通过统一语义锚点实现稳健的生物医学提示和卓越的少样本分类。基于三个互补约束,vMFCoOp 在 14 个医学数据集、12 种医学影像模态和 13 个解剖区域上均实现了一致的改进,超越了当前最先进的方法在准确率、泛化性和临床实用性方面的表现。本工作旨在持续扩展至更多下游应用,相关资源将通过 https://github.com/VinyehShaw/UniEqui 分享。

关键词

引用

@article{arxiv.2511.09540,
  title  = {vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs},
  author = {Minye Shao and Sihan Guo and Xinrun Li and Xingyu Miao and Haoran Duan and Yang Long},
  journal= {arXiv preprint arXiv:2511.09540},
  year   = {2025}
}

备注

Accepted as an Oral Presentation at AAAI 2026 Main Technical Track (this version is not peer-reviewed; it is the extended version)