中文

基于多视角协同学习与视觉语言适配的低资源生物医学图像分类

计算机视觉与模式识别 2026-04-28 v1

摘要

在资源有限的条件下准确地进行生物医学图像分类仍然具有挑战性,主要原因包括标注数据稀缺、类别间视觉差异细微以及疾病语义复杂。虽然视觉--语言模型为缓解数据稀缺性提供了有前景的基础,但其在生物医学场景中的有效适配受限于参数高效调优以及细粒度且语义一致的表征学习需求。本文提出了一种多视角协同学习(Multi-View Synergistic Learning, MVSL)的统一框架,以解决上述挑战,框架中联合考虑了适应性范式、表征粒度以及疾病语义关系。MVSL通过解耦视觉编码器和文本编码器的适应过程,以尊重其各自表征特征的不同,从而实现更稳定且更有效的参数高效微调。进一步引入多粒度对比学习,显式建模全局图像语义与局部病灶级证据,有助于提高视觉上相似疾病类别的细粒度辨别能力。此外,MVSL通过融合来自大语言模型(LLM)生成的结构化监督信息,保留疾病层级的语义结构,从而约束文本表征在类别层面的表达,并通过跨模态对齐间接正则化视觉嵌入。综上,这些组件共同实现了更稳定的跨模态对齐以及在监督信号有限的情况下的辨别能力提升。实验在11个公开生物医学数据集上进行,涵盖9种影像模态和10种解剖部位,结果表明MVSL在few-shot和zero-shot分类设置下均一致优于当前最先进的方法。

关键词

引用

@article{arxiv.2604.23977,
  title  = {Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification},
  author = {Xiaoliu Luo and Minxue Xiao and Ting Xie and Mengzhu Wang and Huiqing Qi and Joey Tianyi Zhou and Taiping Zhang and Xu Wang},
  journal= {arXiv preprint arXiv:2604.23977},
  year   = {2026}
}