Vim4Path: 用于组织病理学图像的自监督视觉Mamba
图像与视频处理
2024-05-28 v2 计算机视觉与模式识别
摘要
从千兆像素全切片图像(WSI)中进行表示学习是计算病理学中的一个重大挑战,因为组织结构复杂且标记数据稀缺。多实例学习方法通过利用图像块,借助自监督学习(SSL)方法预训练的模型对切片进行分类,从而应对了这一挑战。SSL和MIL方法的性能都依赖于特征编码器的架构。本文提出利用受状态空间模型启发的Vision Mamba(Vim)架构,在DINO框架内进行计算病理学的表示学习。我们在Camelyon16数据集上评估了Vim与Vision Transformers(ViT)在图像块级和切片级分类上的性能。我们的发现突出了Vim相比ViT的增强性能,特别是在较小规模上,Vim在相似大小的模型上实现了ROC AUC提升8.21。可解释性分析进一步突出了Vim的能力,揭示了Vim独特地模拟了病理学家的工作流程——与ViT不同。这种与人类专家分析的一致性突显了Vim在实际诊断环境中的潜力,并为开发计算病理学中有效的表示学习算法做出了重要贡献。我们在\url{https://github.com/AtlasAnalyticsLab/Vim4Path}发布代码和预训练权重。
引用
@article{arxiv.2404.13222,
title = {Vim4Path: Self-Supervised Vision Mamba for Histopathology Images},
author = {Ali Nasiri-Sarvi and Vincent Quoc-Huy Trinh and Hassan Rivaz and Mahdi S. Hosseini},
journal= {arXiv preprint arXiv:2404.13222},
year = {2024}
}
备注
Accepted in CVPR2024 (9th Workshop on Computer Vision for Microscopy Image Analysis)