Chebyshev KAN 驱动的 Vision-LSTM 增强 3D 医学图像分割模型 UNETVL
计算机视觉与模式识别
2025-06-17 v2 人工智能
摘要
3D 医学图像分割因卷积神经网络(CNN)和视觉转换器(ViT)而取得了显著进展,但这些方法在获取长程依赖与计算效率之间往往难以取得平衡。为此,我们提出一种新型架构 UNETVL(U-Net Vision-LSTM),利用近期在时序信息处理方面的进展。UNETVL 集成了视觉-LSTM(ViL)以提升可扩展性和内存功能,同时采用高效的 Chebyshev 科赫-阿尔纳姆网络(KAN)更有效地处理复杂的长程依赖模式。我们在 ACDC 和 AMOS2022(后挑战任务 2)基准数据集上进行验证,结果表明与最新方法的平均 Dice 评分显著提升,尤其是相对于其前身 UNETR,分别提升了 7.3% 和 15.6%。针对 UNETVL 的各组成部分,进行了大量消融研究,以全面理解其架构。我们的代码已公开于 https://github.com/tgrex6/UNETVL,旨在促进该领域进一步的研究和应用。
引用
@article{arxiv.2501.07017,
title = {UNetVL: Enhancing 3D Medical Image Segmentation with Chebyshev KAN Powered Vision-LSTM},
author = {Xuhui Guo and Tanmoy Dam and Rohan Dhamdhere and Gourav Modanwal and Anant Madabhushi},
journal= {arXiv preprint arXiv:2501.07017},
year = {2025}
}