Segment as You Wish -- 基于自由文本的医学图像分割
图像与视频处理
2025-07-01 v2 人工智能
计算机视觉与模式识别
摘要
医学影像对于诊断患者健康状况至关重要,准确的图像分割对于隔离感兴趣区域以确保精确诊断和治疗规划至为重要。现有方法主要依赖边界框或基于点的提示,少数探索文本相关提示,尽管临床医生常用自然语言描述其观察和指令。为填补这一空白,我们首先提出了基于检索增强生成(RAG)的自由文本提示生成器,利用领域语料库生成多样且真实的描述。随后,我们引入 FLanS,这是一个处理各种自由文本提示的新型医学图像分割模型,包括专业解剖信息查询、解剖无关位置驱动查询和解剖无关尺寸驱动查询。此外,我们的模型还包含一个利用对称性进行标准化的模块,以确保在不同扫描方向下的一致准确分割,减少解剖位置与扫描中外观表现之间的混淆。FLanS 在超过 10 万张来自 7 个公开数据集的医学图像上进行训练。全面实验表明,该模型在语言理解和分割精度方面表现优异,能够深入理解两者之间的关系,在域内和域外数据集上均优于 SOTA 基线。
引用
@article{arxiv.2410.12831,
title = {Segment as You Wish -- Free-Form Language-Based Segmentation for Medical Images},
author = {Longchao Da and Rui Wang and Xiaojian Xu and Parminder Bhatia and Taha Kass-Hout and Hua Wei and Cao Xiao},
journal= {arXiv preprint arXiv:2410.12831},
year = {2025}
}
备注
19 pages, 9 as main content. The paper was accepted to KDD2025