医学图像分割的视觉测试时训练模型: Med-TTT
图像与视频处理
2024-10-04 v1 计算机视觉与模式识别
摘要
医学图像分割在临床诊断和治疗规划中发挥着至关重要的作用。尽管基于卷积神经网络(CNN)和 Transformer 的模型在医学图像分割任务中取得了显著的成功,但仍面临计算复杂度高以及在捕获长程依赖时丢失局部特征的挑战。为解决这些限制,我们提出了 Med-TTT,这是一种集成测试时训练(TTT)层的视觉主干网络,其具有动态调整能力。Med-TTT 引入了 Vision-TTT 层,能够以线性计算复杂度有效地建模长程依赖,并在推理期间实现自适应参数调整。此外,我们设计了多分辨率融合机制,以组合不同尺度的图像特征,促进对复杂背景中细微病灶特征的识别。同时,我们采用基于高通滤波的频域特征增强策略,能够更好地捕获图像中的纹理和细粒度细节。实验结果表明,Med-TTT 在多个医学图像数据集上显著优于现有方法,在复杂图像背景中展现出强大的分割能力。该模型在准确率、灵敏度和 Dice 系数方面均取得领先性能,为医学图像分割领域提供了一个高效且稳健的解决方案。该代码已在 https://github.com/Jiashu-Xu/Med-TTT 上提供。
引用
@article{arxiv.2410.02523,
title = {Med-TTT: Vision Test-Time Training model for Medical Image Segmentation},
author = {Jiashu Xu},
journal= {arXiv preprint arXiv:2410.02523},
year = {2024}
}