中文

SwinTF3D:一种用于文本引导3D医学图像分割的轻量级多模态融合方法

计算机视觉与模式识别 2025-12-30 v1 人工智能

摘要

最近人工智能与医学成像的整合推动了自动化器官分割的显著进步。然而,大多数现有的3D分割框架完全依赖于从大型标注数据集中进行视觉学习,这限制了它们对新领域和临床任务的适应性。这些模型缺乏语义理解,使其无法有效地应对灵活的、用户定义的分割目标。为了克服这些局限性,我们提出了 SwinTF3D,这是一种轻量级多模态融合方法,统一了视觉和语言表示,用于文本引导的3D医学图像分割。该模型采用基于 Transformer 的视觉编码器来提取体积特征,并通过高效的融合机制将其与紧凑的文本编码器集成。这种设计允许系统理解自然语言提示,并将语义线索与医学体积中相应的空间结构正确对齐,同时以较低的计算开销产生准确的、上下文感知的分割结果。在 BTCV 数据集上的广泛实验表明,尽管其架构紧凑,SwinTF3D 在多个器官上实现了具有竞争力的 Dice 和 IoU 分数。该模型对未见数据具有良好的泛化能力,并且与传统的基于 Transformer 的分割网络相比,提供了显著的效率提升。SwinTF3D 桥接了视觉感知与语言理解,为交互式、文本驱动的3D医学图像分割建立了一个实用且可解释的范式,为临床成像中更具适应性和资源效率的解决方案开辟了前景。

关键词

引用

@article{arxiv.2512.22878,
  title  = {SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation},
  author = {Hasan Faraz Khan and Noor Fatima and Muzammil Behzad},
  journal= {arXiv preprint arXiv:2512.22878},
  year   = {2025}
}