中文

3D计算机断层扫描中视觉语言建模的统一监督

计算机视觉与模式识别 2025-09-03 v1 人工智能 机器学习

摘要

通用视觉语言模型(VLMs)作为放射学中有前景的工具出现,提供零样本能力以减少对大规模标注数据集的需求。然而,在诊断放射学等高风险领域,这些模型通常缺乏可靠临床应用所需的判别精度。这一挑战因公开可用的体积CT数据集的稀缺性和异质性而加剧,这些数据集在标注格式和粒度上差异很大。为解决这些局限性,我们引入了Uniferum,一种体积VLM,将多样化的监督信号(编码在分类标签和分割掩码中)统一到单一训练框架中。通过协调三个具有不同标注的公共3D CT数据集,Uniferum达到了最先进的性能,相比基于CLIP的模型和传统多标签卷积模型,在CT-RATE基准测试上AUROC提升了7%。该模型展现出稳健的分布外泛化能力,在RAD-CHEST和INSPECT数据集上观察到意外的零样本性能证据。我们的结果强调了整合异质标注和身体分割以提升模型性能的有效性,为3D医学成像中临床可靠、数据高效的VLMs开辟了新方向。

关键词

引用

@article{arxiv.2509.01554,
  title  = {Unified Supervision For Vision-Language Modeling in 3D Computed Tomography},
  author = {Hao-Chih Lee and Zelong Liu and Hamza Ahmed and Spencer Kim and Sean Huver and Vishwesh Nath and Zahi A. Fayad and Timothy Deyer and Xueyan Mei},
  journal= {arXiv preprint arXiv:2509.01554},
  year   = {2025}
}

备注

ICCV 2025 VLM 3d Workshop