MSCPT:基于多尺度与上下文聚焦提示调优的少样本全切片图像分类
计算机视觉与模式识别
2025-09-10 v3
摘要
多实例学习(MIL)已成为全切片图像(WSI)弱监督分类的标准范式。然而,该范式依赖大量标注 WSI 进行训练。训练数据的缺乏和罕见疾病的存在对这些方法构成了重大挑战。提示调优结合预训练的视觉-语言模型(VLMs)是解决少样本弱监督 WSI 分类(FSWC)任务的有效方案。然而,将针对自然图像设计的提示调优方法应用于 WSI 面临三个显著挑战:1)这些方法未能充分利用 VLM 文本模态中的先验知识;2)它们忽略了 WSI 中必要的多尺度和上下文信息,导致次优结果;3)它们缺乏对实例聚合方法的探索。为解决这些问题,我们提出了一种多尺度与上下文聚焦提示调优(MSCPT)方法用于 FSWC 任务。具体而言,MSCPT 利用冻结的大语言模型在多个尺度上生成病理视觉语言先验知识,指导分层提示调优。此外,我们设计了一个图提示调优模块来学习 WSI 中的关键上下文信息,最后引入了一个非参数跨引导实例聚合模块来推导 WSI 级别的特征。在五个数据集和三个下游任务上使用三种 VLMs 进行了广泛的实验、可视化和可解释性分析,证明了 MSCPT 的强大性能。所有代码已公开发布于 https://github.com/Hanminghao/MSCPT。
引用
@article{arxiv.2408.11505,
title = {MSCPT: Few-shot Whole Slide Image Classification with Multi-scale and Context-focused Prompt Tuning},
author = {Minghao Han and Linhao Qu and Dingkang Yang and Xukun Zhang and Xiaoying Wang and Lihua Zhang},
journal= {arXiv preprint arXiv:2408.11505},
year = {2025}
}
备注
This work has been submitted to the IEEE TMI for possible publication