ViLa-MIL:基于双尺度视觉语言多实例学习的全切片图像分类
计算机视觉与模式识别
2025-02-13 v1
摘要
基于多实例学习(MIL)的框架已成为处理数字病理学中尺度为吉像素级且具有层次图像上下文的全切片图像(Whole Slide Image, WSI)的主流方法。然而,这些方法高度依赖大量的包级标签,仅从原始切片中学习,容易受数据分布变化的影响。最近,基于视觉语言模型(Vision-Language Model, VLM)的方法通过在大规模病理图像-文本对上进行预训练,引入了语言先验。然而,之前的文本提示未考虑病理先验知识,未能显著提升模型性能。此外,收集此类数据对和预训练过程都非常耗时且资源密集。为解决上述问题,我们提出了一种用于全切片图像分类的双尺度视觉语言多实例学习(ViLa-MIL)框架。具体而言,我们基于冻结的大型语言模型(Large Language Model, LLM)提出了双尺度视觉描述文本提示,以有效提升VLM的性能。为高效地将VLM用于处理WSI,在图像分支中,我们提出了原型引导的补丁解码器,通过将相似的补丁分组到同一原型中来逐步聚合补丁特征;在文本分支中,我们引入了上下文引导的文本解码器,通过融合多粒度图像上下文来增强文本特征。在三个多癌种、多中心的亚型数据集上的大量实验表明,ViLa-MIL的优越性。
引用
@article{arxiv.2502.08391,
title = {ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image Classification},
author = {Jiangbo Shi and Chen Li and Tieliang Gong and Yefeng Zheng and Huazhu Fu},
journal= {arXiv preprint arXiv:2502.08391},
year = {2025}
}
备注
CVPR 2024 (Updated version with corrections for typos and errors.)