SpineSAM-R1:面向脊柱CT分割的视觉语言多模态交互系统
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
从计算断层扫描(CT)图像对脊椎及相邻结构的解剖结构分割是脊椎疾病诊断和治疗的关键步骤。然而,CT图像分割受低对比度和复杂脊椎边界的制约。虽然高级模型如Segment Anything Model(SAM)在 various 分割任务中显示出前景,但其在脊椎CT成像中的性能受限于高标注需求和较差的域适应性。为此,我们提出SpineSAM-R1,一种集成微调SAM与DeepSeek-R1的多模态视觉语言交互系统,用于脊椎CT图像分割。具体而言,SpineSAM-R1引入解剖引导注意力机制以提高脊柱分割性能,并通过DeepSeek-R1驱动的语义驱动交互协议,实现自然语言引导的细化。SpineSAM-R1采用Low-Rank Adaptation(LoRA)进行微调以实现高效适配。我们在脊椎解剖结构的CT图像上对SpineSAM-R1进行了验证。实验结果表明,该方法在分割性能方面取得优异成果。同时,我们开发了基于PyQt5的交互式软件,支持点、框和文本提示。该系统支持11项临床操作,解析准确率达94.3%,响应时间低于800毫秒。该软件已发布于https://github.com/6jm233333/spinalsam-r1。
引用
@article{arxiv.2511.00095,
title = {SpinalSAM-R1: A Vision-Language Multimodal Interactive System for Spine CT Segmentation},
author = {Jiaming Liu and Dingwei Fan and Junyong Zhao and Chunlin Li and Haipeng Si and Liang Sun},
journal= {arXiv preprint arXiv:2511.00095},
year = {2025}
}
备注
2 Tables,5 Figures,16 Equations