MambaMIL+:用于Gigapixel全切片图像的长期上下文模式建模
计算机视觉与模式识别
2025-12-22 v1
摘要
全切片图像(WSI)是计算病理学中重要的数据模态,然而其Gigapixel分辨率和缺乏细粒度注释挑战了传统深度学习模型。多实例学习(MIL)通过将每个WSI 视为包含 patch 级实例的袋子,提供了解决方案,但有效建模包含丰富空间上下文的超长序列仍然困难。最近,Mamba 作为长序列学习的新兴方法,能够以线性时间扩展到数千个 token。然而,尽管其高效性,Mamba 仍受限于空间上下文建模和记忆衰减,限制了其在WSI 分析中的效果。为此,我们提出MambaMIL+,一个新的MIL框架,显式集成空间上下文,同时保持长程依赖建模而不发生记忆遗忘。具体而言,MambaMIL+引入三项创新:(1) 重叠扫描(overlapping scanning),重构 patch 序列以嵌入空间连续性和实例关联;(2) 选择性条纹位置编码器(selective stripe position encoder, S2PE),在编码位置信息的同时缓解固定扫描顺序的偏见;(3) 上下文token选择机制(contextual token selection, CTS),利用监督知识动态放大上下文记忆,以实现稳定的长程建模。广泛在20个基准上进行实验,涵盖诊断分类、分子预测和生存分析,结果表明MambaMIL+ 在 ResNet-50、PLIP 和 CONCH 三种特征提取器下均实现了最先进的性能,凸显其在大规模计算病理学中的有效性和鲁棒性。
引用
@article{arxiv.2512.17726,
title = {MambaMIL+: Modeling Long-Term Contextual Patterns for Gigapixel Whole Slide Image},
author = {Qian Zeng and Yihui Wang and Shu Yang and Yingxue Xu and Fengtao Zhou and Jiabo Ma and Dejia Cai and Zhengyu Zhang and Lijuan Qu and Yu Wang and Li Liang and Hao Chen},
journal= {arXiv preprint arXiv:2512.17726},
year = {2025}
}
备注
18 pages, 11 figures, 10 tables