中文

MGPATH: 用于few-shot WSI 分类的多粒度提示学习视觉语言模型

密码学与安全 2025-02-12 v1

摘要

Whole slide pathology image classification 因巨大的图像尺寸和有限的注释标签,导致模型难以泛化。本文引入一种提示学习方法,用于适配大型视觉语言模型以进行few-shot pathology classification。我们首先将 Prov-GigaPath 视觉基础模型(在 13 亿 张病理图像砖块上预训练)扩展为视觉语言模型,通过添加适配器并在 92.3 万 张图像-文本对上进行对比学习进行对齐。随后使用该模型从few-shot注释中提取视觉特征和文本嵌入,并通过可学习的提示嵌入进行微调。不同于以往方法将提示与冻结特征组合(使用前缀嵌入或自注意力),我们提出多粒度注意力机制,通过比较可学习提示与单个图像块以及它们的组合之间的相互作用。该方法提高了模型捕捉细粒度细节和更广阔背景的能力,从而增强了其对复杂模式在亚区域内的识别能力。为进一步提高准确性,我们利用(不平衡的)最优运输基于视觉-文本距离,以确保模型对数据增强过程中可能出现的扰动具有鲁棒性。在肺、肾和乳腔病理模态上的实验结果表明,我们的方法有效,超过了多个最新竞争者,在多种体系结构(包括 CLIP、PLIP 和集成 PLIP 的 Prov-GigaPath)中 consistently 实现性能提升。

关键词

引用

@article{arxiv.2502.07410,
  title  = {Mining Power Destruction Attacks in the Presence of Petty-Compliant Mining Pools},
  author = {Roozbeh Sarenche and Svetla Nikova and Bart Preneel},
  journal= {arXiv preprint arXiv:2502.07410},
  year   = {2025}
}