Glo-VLMs:利用视觉语言模型进行细粒度病变性肾小球分类
计算机视觉与模式识别
2025-11-18 v1
摘要
视觉语言模型(VLMs)在数字病理学中显示出巨大的潜力,但其效果仍受限于细粒度、疾病特定的分类任务,例如区分肾小球亚型。由于这些亚型之间细微的形态差异,以及将视觉模式与精确临床术语对齐的困难,肾病理学中的自动诊断尤其具有挑战性。在本工作中,我们探讨如何有效地适应大型预训练VLMs以执行细粒度肾小球分类,即使在只有少量标记示例可用的情况下。在本工作中,我们引入Glo-VLMs,一个系统性框架,旨在探索VLMs适应细粒度肾小球分类的潜力,尤其是在数据受限的环境中。我们的方法利用精选的病理图像和临床文本提示,以促进联合图像-文本表示学习,以实现细微的肾病理亚型。通过在少样本学习范式下评估各种VLMs架构和适应策略,我们探讨了方法选择和标记数据量如何影响临床相关场景中的模型性能。为确保公平比较,我们使用标准化的多类指标评估所有模型,以阐明大型预训练模型在专业临床研究应用中的实际要求和潜力。结果表明,仅需每类8个样本,微调VLMs即可实现0.7416的准确率、0.9045的宏观AUC和0.5277的F1分数,表明即使在高度受限的监督下,基础模型仍然可以有效适应用于细粒度医学图像分类。
引用
@article{arxiv.2508.15960,
title = {Glo-VLMs: Leveraging Vision-Language Models for Fine-Grained Diseased Glomerulus Classification},
author = {Zhenhao Guo and Rachit Saluja and Tianyuan Yao and Quan Liu and Yuankai Huo and Benjamin Liechty and David J. Pisapia and Kenji Ikemura and Mert R. Sabuncu and Yihe Yang and Ruining Deng},
journal= {arXiv preprint arXiv:2508.15960},
year = {2025}
}