通过原型驱动的语义近似缓解医学语言引导分段中的文本依赖问题
计算机视觉与模式识别
2025-07-22 v3
摘要
医学语言引导分段将文本临床报告作为辅助指导以增强图像分段,已显示出显著优于单模态方法的改进。然而,其固有的对配对图像-文本输入的依赖,我们称之为"文本依赖",存在两个根本性限制:1)许多医学分段数据集缺乏配对报告,导致大量仅包含图像的数据无法用于训练;2)推理仅限于配对报告可用的病例分析,限制了其在大多数临床场景中的应用,因为通常在报告撰写之前才进行分段。为解决这些限制,我们提出了ProLearn,即首个基于原型驱动的学习框架,用于语言引导分段,根本性地缓解了文本依赖问题。其核心,我们引入了一种新的原型驱动语义近似(PSA)模块,以实现来自文本输入的语义指导近似。PSA通过从文本报告中提炼出与分段相关的语义,初始化一个离散且紧凑的原型空间。一旦初始化,它支持查询-响应机制,为没有文本输入的图像近似语义指导,从而缓解了文本依赖。广泛的实验在QaTa-COV19、MosMedData+和Kvasir-SEG上证明,ProLearn在有限文本可用时优于最先进的语言引导方法。
引用
@article{arxiv.2507.11055,
title = {Alleviating Textual Reliance in Medical Language-guided Segmentation via Prototype-driven Semantic Approximation},
author = {Shuchang Ye and Usman Naseem and Mingyuan Meng and Jinman Kim},
journal= {arXiv preprint arXiv:2507.11055},
year = {2025}
}
备注
Accepted to ICCV 2025