基于文本引导的多分辨率病理语言预训练模型
计算机视觉与模式识别
2025-04-29 v1
摘要
在计算病理学(CPath)中,引入视觉语言模型(VLM)为研究开辟了新的研究方向,主要在单个放大倍数级别上对齐图像文本对。然而,这种方法可能不足以满足癌症亚型分类、组织表型学和生存分析等任务,因为单分辨率图像提供的细节有限。为此,我们提出一种新颖的多分辨率范式,利用全切片图像(WSIs)在多个分辨率上提取组织切片块,并通过先进的CPath VLM生成相应的文本描述。我们在多个分辨率上实现视觉-文本对齐,以及跨分辨率对齐,以更有效地建立文本引导的视觉表征。基于多模态编码器的跨分辨率对齐增强了模型从组织图像中捕获多分辨率上下文的能力。我们的模型旨在捕获更广泛的信息,借助新颖的损失函数丰富特征表征,提高判别能力,并增强在不同分辨率上的泛化能力。在拥有3400万多尺度图像-文本对的全面TCGA数据集上进行预训练,我们的微调模型在多个数据集和任务上均超越了当前最先进(SOTA)的方法,显示其在CPath中的有效性。代码已在GitHub上提供:https://github.com/BasitAlawode/MR-PLIP
引用
@article{arxiv.2504.18856,
title = {Multi-Resolution Pathology-Language Pre-training Model with Text-Guided Visual Representation},
author = {Shahad Albastaki and Anabia Sohail and Iyyakutti Iyappan Ganapathi and Basit Alawode and Asim Khan and Sajid Javed and Naoufel Werghi and Mohammed Bennamoun and Arif Mahmood},
journal= {arXiv preprint arXiv:2504.18856},
year = {2025}
}