中文

PPBoost:渐进式文本驱动医学图像分割提示提升

计算机视觉与模式识别 2025-12-01 v1

摘要

文本提示的基础模型用于医学图像分割提供了一种直观的方式,用于从自然语言查询中描绘解剖结构,但其预测常缺乏空间精度,在域迁移下性能下降。相比之下,基于视觉提示的模型通过利用精确的边界框(bbox)提示中的空间线索来指导目标病灶的分割,实现了跨多种模态的强分割性能。然而,在临床实践中获取精确的视觉提示成本较高且具有挑战性。我们提出PPBoost(渐进式提示提升),一个框架通过将弱文本信号转化为强的、以空间为导向的视觉提示,构建于严格的零样例 regime下,无需图像或像素级别的分割标签。PPBoost首先使用视觉语言模型在文本对象描述条件下生成初始伪bbox,并应用不确定性感知准则筛选不可靠的预测。保留下来的图像-bbox对用于训练伪标签检测器,生成查询图像的高质量bbox。推理期间,PPBoost进一步通过适当扩展bbox以紧密覆盖目标解剖结构来细化生成的bbox。增强的以空间为导向的bbox提示引导现有的分割模型生成最终的稠密掩码,有效地将弱文本线索放大为强空间指导。跨越三个涵盖多种模态和解剖结构的数据集,PPBoost在Dice系数和归一化表面距离上 consistently 超过文本和视觉提示的基线,尤其在不使用标签数据的情况下超过few-shot分割模型。PPBoost可以推广到多个典型的视觉分割模型 backbone。

关键词

引用

@article{arxiv.2511.21984,
  title  = {PPBoost: Progressive Prompt Boosting for Text-Driven Medical Image Segmentation},
  author = {Xuchen Li and Hengrui Gu and Mohan Zhang and Qin Liu and Zhen Tan and Xinyuan Zhu and Huixue Zhou and Tianlong Chen and Kaixiong Zhou},
  journal= {arXiv preprint arXiv:2511.21984},
  year   = {2025}
}