Causal-SAM-LLM:作为因果推理器的大型语言模型用于鲁棒医学分割
计算机视觉与模式识别
2026-01-19 v2 人工智能
计算与语言
摘要
深度学习模型在医学图像分割中的临床实用性因其无法泛化到未见领域而受到严重限制。这种失败通常源于模型学习了解剖内容与领域特定成像风格之间的虚假相关性。为克服这一根本性挑战,我们引入了Causal-SAM-LLM,一个新颖的框架,将大型语言模型(LLMs)提升到因果推理器的角色。我们的框架构建于冻结的Segment Anything Model(SAM)编码器之上,包含两项协同创新。首先,语言对抗解缠(LAD)使用视觉-语言模型生成混淆图像风格的丰富文本描述。通过训练分割模型的特征与这些风格描述形成对比性不相似,它学习到一个鲁棒地清除了非因果信息的表示。其次,测试时因果干预(TCI)提供了一种交互机制,其中LLM解释临床医生的自然语言命令以实时调节分割解码器的特征,从而实现有针对性的错误修正。我们在来自四个公开数据集(BTCV、CHAOS、AMOS、BraTS)的复合基准上进行了广泛的经验评估,评估了跨扫描仪、跨模态和跨解剖设置下的泛化能力。Causal-SAM-LLM在分布外(OOD)鲁棒性方面建立了新的最先进水平,在平均Dice分数上提高了多达6.2个点,并将Hausdorff距离比最强基线减少了15.8毫米,同时使用的可训练参数不到完整模型的9%。我们的工作为构建鲁棒、高效且可交互控制的医学AI系统开辟了新道路。
引用
@article{arxiv.2507.03585,
title = {Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation},
author = {Tao Tang and Shijie Xu and Jionglong Su and Zhixiang Lu},
journal= {arXiv preprint arXiv:2507.03585},
year = {2026}
}
备注
Accepted by IEEE ICASSP 2026