将上下文聚类与视觉状态空间模型融合用于医学图像分割
计算机视觉与模式识别
2025-01-06 v1 人工智能
摘要
医学图像分割要求对全局和局部特征表示进行聚合,当前方法在处理长程和短程特征相互作用方面存在挑战。最近,视觉mamba(ViM)模型因在线性复杂度下卓越地处理长程特征迭代而成为有前景的解决方案。然而,现有的ViM方法忽略了保留短程局部依赖性的重要性,方法通过直接展平空间标记,且受限于固定的扫描模式,限制了对动态空间上下文信息的捕获。为此,我们引入一种名为上下文聚类ViM(CCViM)的简单而有效的方法,在现有ViM模型中集成上下文聚类模块,以便对图像标记分割为离散窗口,以实现可适应的局部聚类。我们的方法有效地组合了长程和短程特征相互作用,从而增强了医学图像分割任务中的空间上下文表示。在多样化的公共数据集上进行的广泛实验评估,包括Kumar、CPM17、ISIC17、ISIC18和Synapse,均显示我们的方法在性能上优于当前最先进的方法。我们的代码可在https://github.com/zymissy/CCViM找到。
引用
@article{arxiv.2501.01618,
title = {Merging Context Clustering with Visual State Space Models for Medical Image Segmentation},
author = {Yun Zhu and Dong Zhang and Yi Lin and Yifei Feng and Jinhui Tang},
journal= {arXiv preprint arXiv:2501.01618},
year = {2025}
}
备注
Our paper has been accepted by the IEEE Transactions on Medical Imaging. Our code can be found at https://github.com/zymissy/CCViM