基于视觉语言模型的少样本组织病理实例学习中的切片级提示学习
计算机视觉与模式识别
2025-03-24 v1
摘要
本文针对组织病理全切片图像(WSI)中的少样本分类任务,利用基础视觉语言模型(VLM)和切片级提示学习。鉴于 WSI 的巨比例尺,传统的多实例学习(MIL)方法依赖聚合函数从 patch 表示中推导出切片级(bag 级)预测,这需要大量的切片级标签进行训练。相比之下,VLM 方法在视觉嵌入与候选类文本提示之间对齐方面表现突出,但缺乏必需的病理先验知识。我们的方法通过语言模型识别关键局部组织类型(patch)以进行 WSIs 分类,将此整合到 VLM-based MIL 框架中。我们的方法有效地将 patch 图像与组织类型对齐,并通过仅使用每个类别少量标记的 WSIs 进行提示学习来微调模型。在真实世界的病理 WSIs 数据集上的实验以及消融研究表明,我们的方法在少样本 WSIs 分类任务中优于现有的 MIL 和 VLM 方法。我们的模型代码已公开于 https://github.com/LTS5/SLIP。
引用
@article{arxiv.2503.17238,
title = {Slide-Level Prompt Learning with Vision Language Models for Few-Shot Multiple Instance Learning in Histopathology},
author = {Devavrat Tomar and Guillaume Vray and Dwarikanath Mahapatra and Sudipta Roy and Jean-Philippe Thiran and Behzad Bozorgtabar},
journal= {arXiv preprint arXiv:2503.17238},
year = {2025}
}
备注
Accepted to ISBI 2025