文本驱动的多平面视觉交互用于半监督医学图像分割
计算机视觉与模式识别
2025-07-17 v1
摘要
半监督医学图像分割是缓解数据标注高成本的关键技术。当标注数据有限时,文本信息可以提供额外的上下文来增强视觉语义理解。然而,探索利用文本数据增强3D医学成像任务中视觉语义嵌入的研究仍然很少。在本文中,我们提出了一种新颖的文本驱动多平面视觉交互框架用于半监督医学图像分割(称为Text-SemiSeg),它由三个主要模块组成:文本增强多平面表示(TMR)、类别感知语义对齐(CSA)和动态认知增强(DCA)。具体来说,TMR通过平面映射促进文本-视觉交互,从而增强视觉特征的类别感知能力。CSA在引入可学习变量的文本特征与视觉特征的中间层之间执行跨模态语义对齐。DCA通过标记和未标记数据之间的交互减少它们的分布差异,从而提高模型的鲁棒性。最后,在三个公开数据集上的实验表明,我们的模型有效地利用文本信息增强了视觉特征,并且优于其他方法。我们的代码可在https://github.com/taozh2017/Text-SemiSeg获取。
引用
@article{arxiv.2507.12382,
title = {Text-driven Multiplanar Visual Interaction for Semi-supervised Medical Image Segmentation},
author = {Kaiwen Huang and Yi Zhou and Huazhu Fu and Yizhe Zhang and Chen Gong and Tao Zhou},
journal= {arXiv preprint arXiv:2507.12382},
year = {2025}
}
备注
10 pages; 2 figures; Have been accepted by MICCAI 2025