MamMIL:基于状态空间模型的全切片图像多实例学习
计算机视觉与模式识别
2024-10-31 v3
摘要
最近,病理诊断通过结合深度学习模型与使用全切片图像(WSI)的多实例学习(MIL)框架取得了卓越的性能。然而,WSI 的十亿像素特性对高效 MIL 构成了巨大挑战。现有研究要么未考虑实例间的全局依赖关系,要么使用线性注意力等近似方法来建模成对实例交互,这不可避免地带来了性能瓶颈。为了应对这一挑战,我们提出了一个名为 MamMIL 的 WSI 分析框架,通过将选择性结构化状态空间模型(即 Mamba)与 MIL 相结合,能够在保持线性复杂度的同时对全局实例依赖关系进行建模。具体而言,考虑到 WSI 中组织区域的不规则性,我们将每个 WSI 表示为无向图。为了解决 Mamba 只能处理一维序列的问题,我们进一步提出了一种拓扑感知扫描机制,在对 WSI 图进行序列化的同时保留实例间的拓扑关系。最后,为了进一步感知实例间的拓扑结构并纳入短程特征交互,我们提出了一种基于图神经网络的实例聚合块。实验表明,MamMIL 能够实现比最先进框架更优越的性能。代码可在 https://github.com/Vison307/MamMIL 获取。
引用
@article{arxiv.2403.05160,
title = {MamMIL: Multiple Instance Learning for Whole Slide Images with State Space Models},
author = {Zijie Fang and Yifeng Wang and Ye Zhang and Zhi Wang and Jian Zhang and Xiangyang Ji and Yongbing Zhang},
journal= {arXiv preprint arXiv:2403.05160},
year = {2024}
}
备注
6 pages, 2 figures. Accepted by IEEE International Conference on Bioinformatics and Biomedicine (BIBM)