面向视觉语言医学分割的轻量级时序适配器:T-Gated Adapter
计算机视觉与模式识别
2026-04-10 v1
摘要
医学图像分割传统上依赖于完全监督的3D架构,需要来自临床专家的大量稠密、体素级标注,这是一个代价高昂的过程。视觉语言模型(VLMs)提供了一种强大的替代方案,通过利用来自数十亿图像中学习的广泛视觉语义表示。然而,这些模型独立应用于3D扫描的2D切片时,常常会产生噪声和解剖学上不合理的分割,违反了解剖结构固有的连续性。我们提出了一种时序适配器,通过直接注入相邻切片的上下文来解决这一问题,注入到模型视觉标记表示中。该适配器包含一个在标记级别上注意力跨固定上下文窗口的时序变换器、一个在切片内细化表示的空间上下文块,以及一个自适应门控时序和单切片特征。我们在FLARE22数据集上的30个标记体积上进行训练,该方法在13个腹部器官上实现了0.704的平均Dice分数,相较于没有时序上下文训练的基线VLM提升了+0.206。在BTCV和AMOS22数据集上的零样本评估显示,分别提升了+0.210和+0.230,平均跨域性能下降从38.0%降至24.9%。此外,在AMOS22 MRI上的跨模态评估中,尽管该模型未接受任何MRI监督,我们的方法实现了0.366的平均Dice分数,优于仅在CT上训练的完全监督3D基线(DynUNet,0.224),表明CLIP的视觉语义表示在不同成像模态之间的泛化能力比卷积特征更成熟。
引用
@article{arxiv.2604.08167,
title = {T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation},
author = {Pranjal Khadka},
journal= {arXiv preprint arXiv:2604.08167},
year = {2026}
}
备注
Accepted at the PHAROS-AIF-MIH Workshop at CVPR 2026