BiPVL-Seg:基于双向渐进式视觉语言融合与全局-局部对齐的数字医学图像分割
计算机视觉与模式识别
2025-04-01 v1 人工智能
摘要
医学图像分割通常仅依赖视觉数据,忽略了临床医生在诊断中使用的丰富文本信息。视觉语言模型试图弥合这一差距,但现有方法常常独立处理视觉和文本特征,导致跨模态对齐较弱。简单的融合技术难以应对视觉特征与序列文本嵌入之间的根本差异。此外,医学术语偏离常规语言,限制了即插即用文本编码器的效果,并进一步阻碍了视觉语言对齐。我们提出 BiPVL-Seg,一个集成视觉语言融合与嵌入对齐的端到端框架,通过架构和训练创新实现两者相互强化,以增强医学图像分割。BiPVL-Seg 引入双向渐进式融合架构,促进视觉和文本编码器之间分阶段信息交换。此外,它融入全局-局部对比对齐,这一训练目标通过在类别和概念层面对齐文本和视觉嵌入来增强文本编码器的理解能力。在覆盖 CT 和 MR 多模态医学成像基准的广泛实验中,证明 BiPVL-Seg 在复杂多类分割任务中优于现有 SOTA 方法。源代码已在本 GitHub 仓库提供。
引用
@article{arxiv.2503.23534,
title = {BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation},
author = {Rafi Ibn Sultan and Hui Zhu and Chengyin Li and Dongxiao Zhu},
journal= {arXiv preprint arXiv:2503.23534},
year = {2025}
}