中文

分割、检测与解释:面向CT外观推理的统一框架

计算机视觉与模式识别 2026-05-18 v1

摘要

深度学习的最新进展显著推动了CT图像分析,特别是在分割任务上。然而,这些进展主要局限于图像级别的模式识别,大多数方法缺乏显式的解剖学或上下文推理。大型视觉语言模型为图像分析引入了语言上下文,但多数方法通常聚焦于单一任务,这对于需要多种细粒度分析类型(如解剖结构检测与分割)的临床工作流分析而言是不够的。本文提出一个统一的回归框架,将语言引导的视觉推理集成到CT解读中。我们的方法引入了任务路由令牌,这些令牌基于大型视觉语言模型的隐藏状态触发检测和分割头,从而能够连贯地生成视觉输出(如掩码和边界框)与文本推理。为逐步提升定位精度和语义清晰度,我们进一步设计了一种“近距观察”机制,允许模型在精细化的视野下对感兴趣区域进行从粗到细的渐进式访问。为支持模型训练与评估,我们整理了一个新的多模态CT数据集,包含像素级掩码、边界框、空间提示以及通过AI辅助标注与人工验证过程构建的视觉对象结构化描述。在公开基准上的实验表明,我们的方法相较于当前最优技术(SoTA)取得了持续改进,在BTCV上Dice系数提升达1.0%,在MosMed+上提升达1.7%,同时额外提供了外观推理输出。代码与数据集将公开。

关键词

引用

@article{arxiv.2605.15997,
  title  = {Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning},
  author = {Yuyuan Liu and Can Peng and Yingyu Yang and Qianye Yang and Cheng Ouyang and J. Alison Noble},
  journal= {arXiv preprint arXiv:2605.15997},
  year   = {2026}
}

备注

8 pages, 4 figures, submitted to IEEE Transactions on Medical Imaging (TMI)