中文

ESICA:面向3D医学图像分割的可扩展文本引导框架

计算机视觉与模式识别 2026-04-29 v1

摘要

文本引导的3D医学图像分割通过允许用户直接以自然语言指定感兴趣区域,提供了对基于类的模型和基于空间提示模型的灵活替代方案。该范例避免了对预定义标签集的依赖,减少了歧义输出,并更自然地与临床工作流程一致。然而,现有的文本引导框架往往计算昂贵、文本体积特征对齐较弱,无法捕获细微的解剖细节。我们提出ESICA,一个轻量且可扩展的框架,通过三项创新措施解决上述挑战:(1)基于相似度矩阵的掩码预测公式以增强语义对齐;(2)具有适配器模块的高效分解解码器以实现精确的三维解码;(3)两 pass精炼策略以锐化边界并解决不确定区域。为提高训练稳定性和泛化能力,ESICA采用由纯正预训练 followed by平衡fine tuning组成的两阶段方案。在覆盖CT、MRI、PET、超声和显微镜五种成像模态的CVPR BiomedSegFM基准测试中,ESICA实现了最先进的分割精度,而紧凑的ESICA4 Lite变体在显著减少参数数量的同时也达到了类似的分割性能,实现了卓越的效率精度权衡。我们的框架将文本引导分割推向高效、可扩展且可部署于临床的系统。代码将在https://github.com/mirthAI/ESICA上公开。

关键词

引用

@article{arxiv.2604.24876,
  title  = {ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation},
  author = {Yu Xin and Gorkem Can Ates and Jun Ma and Sumin Kim and Ying Zhang and Kaleb E Smith and Kuang Gong and Wei Shao},
  journal= {arXiv preprint arXiv:2604.24876},
  year   = {2026}
}