中文

OmniCT: 面向全面 CT 分析的统一切片-体积大型视觉语言模型

计算机视觉与模式识别 2026-03-03 v2 人工智能

摘要

计算机断层扫描(CT)是最广泛使用的且信息密集的成像模态之一,涵盖心脏、肺脏、肝脏和结肠等关键器官。临床解读依赖于切片驱动的局部特征(如亚厘米结节、病灶边界)和体积驱动的空间表示(如肿瘤渗透、器官间解剖关系)。然而,现有的大型视觉语言模型(LVLMs)在 CT 切片与体积理解方面仍然碎片化:切片驱动型 LVLMs 表现出强大的泛化能力,但缺乏跨切片的空间一致性;而体积驱动型 LVLMs 能显式捕获体积语义,但受限于粗糙的分辨率和与切片输入的 poor compatibility。缺乏统一的建模范式构成了医学 LVLMs 临床转化的主要瓶颈。我们提出的 OmniCT 是一种用于 CT 场景的强大统一切片-体积 LVLM,主要贡献包括:(i)空间一致性增强(SCE):结合三轴位置嵌入的体积切片组成,引入体积一致性,MoE 混合投影实现高效的切片-体积适配;(ii)器官级语义增强(OSE):通过分割和 ROI 定位显式对齐解剖区域,强调病灶和器官级语义;(iii)MedEval-CT:最大规模的切片-体积 CT 数据集和混合基准,集成全面指标以实现统一评估。OmniCT 在多样临床任务上均显著优于现有方法,同时满足微观细节灵敏度和宏观空间推理的需求。更重要的是,它建立了跨模态医学影像理解的新范式。我们的项目已公开于 https://github.com/ZJU4HealthCare/OmniCT。

关键词

引用

@article{arxiv.2602.16110,
  title  = {OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis},
  author = {Tianwei Lin and Zhongwei Qiu and Wenqiao Zhang and Jiang Liu and Yihan Xie and Mingjian Gao and Zhenxuan Fan and Zhaocheng Li and Sijing Li and Zhongle Xie and Peng LU and Yueting Zhuang and Ling Zhang and Beng Chin Ooi and Yingda Xia},
  journal= {arXiv preprint arXiv:2602.16110},
  year   = {2026}
}