面向肺动脉和静脉 3D 分割的自适应视觉-语言模型
计算机视觉与模式识别
2025-01-08 v1 人工智能
摘要
肺部结构的精确分割在临床诊断、疾病研究和治疗规划中至关重要。尽管深度学习分割技术取得了显著进展,但大多数方法需要大量标记数据进行训练。因此,开发需求标记数据更少的精确分割方法在医学图像分析中至关重要。近期,像 CLIP 等预训练视觉-语言基础模型的出现,为通用计算机视觉任务开辟了可能性。利用这些预训练基础模型在下游任务(如分割)上的泛化能力,能够以相对较少的标记数据实现意想不到的性能。然而,探索这些模型用于肺动脉-静脉分割仍有限。本文提出一种名为 Language-guided self-adaptive Cross-Attention Fusion Framework 的新型框架。该方法采用预训练 CLIP 作为强大的特征提取器,用于生成 3D CT 扫描的分割,同时自适应地聚合文本和图像表示的跨模态。我们提出了一个特别设计的适配器模块,通过自适应学习策略对预训练 CLIP 进行微调,以有效融合两种模态的嵌入。我们在本地数据集上广泛验证了该方法,该数据集是目前规模最大的肺动脉-静脉 CT 数据集,总计 718 条标记数据。实验表明,该方法在其他 SOTA 方法上取得了大幅优势。我们的数据和代码将在接受后公开。
引用
@article{arxiv.2501.03722,
title = {Self-adaptive vision-language model for 3D segmentation of pulmonary artery and vein},
author = {Xiaotong Guo and Deqian Yang and Dan Wang and Haochen Zhao and Yuan Li and Zhilin Sui and Tao Zhou and Lijun Zhang and Yanda Meng},
journal= {arXiv preprint arXiv:2501.03722},
year = {2025}
}
备注
8 pages,3 figures