中文

CNN 为何在牙冠龋病分割中超越 Transformer 与 Mamba:重新审视深度网络架构

计算机视觉与模式识别 2025-11-20 v1 人工智能

摘要

对牙冠龋病在全景牙科 X 光片中的精准识别与分割对于早期诊断和有效治疗规划至关重要。由于龋病对比度低、形态变异大以及标注数据有限,自动化分割仍具有挑战性。本研究首次通过 DC1000 数据集,对卷积神经网络、视觉转换器和状态空间 Mamba 架构用于牙冠龋病自动化分割进行全面基准测试。12 种最先进的架构,包括 VMUnet、MambaUNet、VMUNetv2、RMAMamba-S、TransNetR、PVTFormer、DoubleU-Net 和 ResUNet++,在相同配置下进行训练。结果显示,与日益趋向复杂注意力架构的发展趋势相反,基于 CNN 的 DoubleU-Net 取得了 0.7345 的 dice 系数、0.5978 的 mIoU 和 0.8145 的精确率,超过了所有基于 Transformer 和 Mamba 的变体。在本研究中,所有性能指标的前三名均由基于 CNN 的架构实现。尽管 Mamba 和基于 Transformer 的方法在全局上下文建模方面具有理论优势,但因数据有限和空间先验较弱,实际表现不佳。这凸显了特定医学图像分割任务中架构与任务匹配的重要性,远远超过模型复杂度的重要性。我们的代码可在 https://github.com/JunZengz/dental-caries-segmentation 获取。

关键词

引用

@article{arxiv.2511.14860,
  title  = {When CNNs Outperform Transformers and Mambas: Revisiting Deep Architectures for Dental Caries Segmentation},
  author = {Aashish Ghimire and Jun Zeng and Roshan Paudel and Nikhil Kumar Tomar and Deepak Ranjan Nayak and Harshith Reddy Nalla and Vivek Jha and Glenda Reynolds and Debesh Jha},
  journal= {arXiv preprint arXiv:2511.14860},
  year   = {2025}
}

备注

8 pages, 4 figures