利用视觉语言嵌入实现组织病理学图像零样本学习
计算机视觉与模式识别
2025-03-17 v1
摘要
零样本学习通过使模型在没有大量标注数据的情况下泛化到未见类别,在组织病理学图像分析中具有巨大潜力。视觉语言模型(VLMs)的最新进展扩展了零样本学习的能力,使模型无需特定任务的微调即可执行任务。然而,将VLMs应用于组织病理学面临相当大的挑战,这是由于组织病理学图像的复杂性和诊断任务的细微性质。在本文中,我们提出了一种名为多分辨率提示引导混合嵌入(MR-PHE)的新框架,以解决组织病理学图像零样本分类中的这些挑战。MR-PHE利用多分辨率块提取来模拟病理学家的诊断工作流程,捕捉对准确诊断至关重要的细粒度细胞细节和更广泛的组织结构。我们引入了一种混合嵌入策略,将全局图像嵌入与加权块嵌入相结合,有效地结合了局部和全局上下文信息。此外,我们开发了一个全面的提示生成和选择框架,通过添加领域特定的同义词和临床相关特征来丰富类别描述,以增强语义理解。基于相似性的块加权机制根据块与类别嵌入的相关性分配注意力类权重,在分类过程中强调诊断上重要的区域。我们的方法利用预训练的VLM CONCH进行零样本学习,无需领域特定的微调,具有可扩展性并减少了对大型标注数据集的依赖。实验结果表明,MR-PHE不仅显著提高了组织病理学数据集上的零样本分类性能,而且常常超越完全监督模型。
引用
@article{arxiv.2503.10731,
title = {Leveraging Vision-Language Embeddings for Zero-Shot Learning in Histopathology Images},
author = {Md Mamunur Rahaman and Ewan K. A. Millar and Erik Meijering},
journal= {arXiv preprint arXiv:2503.10731},
year = {2025}
}