PixelCAM:基于像素的类别激活映射用于组织学图像分类与 ROI 定位
计算机视觉与模式识别
2026-04-15 v4
摘要
弱监督对象定位(WSOL)方法允许模型在仅需低成本图像类别标注的情况下进行分类和 ROI 定位,提供可视化可解释的分类器。标准 WSOL 方法依赖类别激活映射(CAM)方法,通过单步骤或双步骤策略产生空间局化图。尽管两种策略均取得了显著进展,但在组织学图像上仍面临若干局限。单步骤方法容易导致激活不足或过度,由于组织学图像中视觉 ROI 的显著性有限且局化线索稀缺。它们还面临分类与局化任务异步收敛的已知问题。双步骤方法受限于冻结的分类器,限制了局化的能力。此外,这些方法在应用于分布外(OOD)数据集时也表现不佳。本文提出一种多任务方法,用于 WSOL,同时训练分类与局化任务,以解决异步收敛问题。具体而言,局化在与分类共享的图像编码器的像素特征空间中完成。这允许学习判别特征并准确描绘前景/背景区域,以支持 ROI 定位和图像分类。我们提出 PixelCAM,在像素特征空间中构建一种成本效益高的前景/背景像素级分类器,以实现空间对象局化。通过部分交叉熵损失,PixelCAM 使用来自预训练 WSOL 模型收集的像素伪标签进行训练。图像级和像素级分类器同时使用标准梯度下降进行训练。此外,我们的像素分类器可以轻松集成到 CNN 和 transformer 架构中,而无需任何修改。
引用
@article{arxiv.2503.24135,
title = {PixelCAM: Pixel Class Activation Mapping for Histology Image Classification and ROI Localization},
author = {Alexis Guichemerre and Soufiane Belharbi and Mohammadhadi Shateri and Luke McCaffrey and Eric Granger},
journal= {arXiv preprint arXiv:2503.24135},
year = {2026}
}
备注
43 pages, 24 figures, Medical Imaging with Deep Learning (MIDL 2025)