中文

Chebyshev KAN 驱动的 Vision-LSTM 增强 3D 医学图像分割模型 UNETVL

计算机视觉与模式识别 2025-06-17 v2 人工智能

摘要

3D 医学图像分割因卷积神经网络(CNN)和视觉转换器(ViT)而取得了显著进展,但这些方法在获取长程依赖与计算效率之间往往难以取得平衡。为此,我们提出一种新型架构 UNETVL(U-Net Vision-LSTM),利用近期在时序信息处理方面的进展。UNETVL 集成了视觉-LSTM(ViL)以提升可扩展性和内存功能,同时采用高效的 Chebyshev 科赫-阿尔纳姆网络(KAN)更有效地处理复杂的长程依赖模式。我们在 ACDC 和 AMOS2022(后挑战任务 2)基准数据集上进行验证,结果表明与最新方法的平均 Dice 评分显著提升,尤其是相对于其前身 UNETR,分别提升了 7.3% 和 15.6%。针对 UNETVL 的各组成部分,进行了大量消融研究,以全面理解其架构。我们的代码已公开于 https://github.com/tgrex6/UNETVL,旨在促进该领域进一步的研究和应用。

关键词

引用

@article{arxiv.2501.07017,
  title  = {UNetVL: Enhancing 3D Medical Image Segmentation with Chebyshev KAN Powered Vision-LSTM},
  author = {Xuhui Guo and Tanmoy Dam and Rohan Dhamdhere and Gourav Modanwal and Anant Madabhushi},
  journal= {arXiv preprint arXiv:2501.07017},
  year   = {2025}
}