中文

从分类到跨模态理解:利用视觉语言模型进行精细肾脏病理学

计算机视觉与模式识别 2025-11-18 v1

摘要

精细肾小球亚型是肾活检解释的核心内容,但临床有价值的标签稀缺且难以获取。现有计算病理学方法倾向于在完全监督下使用仅图像的模型评估粗糙的疾病分类,因此尚不清楚视觉语言模型(VLM)应如何在数据受限的情况下适应临床有意义的亚型。本文将精细肾小球亚型建模为临床现实的少样本问题,系统评估了病理专用和通用视觉语言模型在此设置下的表现。我们不仅评估分类性能(准确率、AUC、F1),还检查所学表示的几何结构,检验图像和文本嵌入之间的特征对齐以及肾小球亚型的可分离性。通过联合分析 shot 数量、模型架构和领域知识以及适应策略,本研究为未来模型选择和训练在真实临床数据约束下提供了指导。我们的结果表明,病理专用视觉语言主干模型配合基础微调是最有效的起点。即使仅用 4-8 个标记样本即可捕捉到亚型间的差异,显示出显著的判别和校准提升,尽管额外的监督仍带来增量性改进。我们还发现,正负样本之间的判别力与图像-文本对齐一样重要。总体而言,我们的结果表明,监督水平和适应策略共同塑造了诊断性能和多模态结构,为模型选择、适应策略和标注投入提供了指导。

关键词

引用

@article{arxiv.2511.11984,
  title  = {From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology},
  author = {Zhenhao Guo and Rachit Saluja and Tianyuan Yao and Quan Liu and Junchao Zhu and Haibo Wang and Daniel Reisenbüchler and Yuankai Huo and Benjamin Liechty and David J. Pisapia and Kenji Ikemura and Steven Salvatoree and Surya Seshane and Mert R. Sabuncu and Yihe Yang and Ruining Deng},
  journal= {arXiv preprint arXiv:2511.11984},
  year   = {2025}
}