VoxelFM:基于自蒸馊训练的3D CT基础模型
计算机视觉与模式识别
2026-04-07 v1 人工智能
摘要
在CT人工智能系统开发方面,广泛关注如何支持放射科医生完成从分割到报告生成的各类任务。现有CT基础模型主要聚焦于构建通用的视觉-语言系统,能够执行问答和报告生成等任务。然而,训练可靠的视觉-语言系统需要大规模的配对图像-文本数据,而这在CT领域尚不可获得。此外,将底层视觉表征适配下游任务通常需要部分或全部微调底层网络,这对许多研究小组来说计算负拴沉重。相反,基础模型应优先学习鲁棒的视觉表征,以实现在有限标注数据且无需底层微调的情况下高效迁移到新任务。我们提出VoxelFM,一种基于DINO框架进行自蒸馊训练的3D CT基础模型,无需语言监督即可学习语义丰富的特征。我们在七类临床相关下游任务上评估了VoxelFM,采用冻结主干网络搭配轻量级探针:分类、回归、生存分析、实例检索、定位、分割和报告生成。VoxelFM在所有任务类别中均与或超过四个现有CT基础模型。尽管预训练期间未获得语言监督,VoxelFM在报告生成等任务上甚至超越了采用语言对齐目标训练的模型。我们的结果表明,当前CT基础模型作为轻量级探针的特征提取器性能显著优于作为视觉-语言模型的视觉编码器。模型权重和训练代码已公开。
引用
@article{arxiv.2604.04133,
title = {Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks},
author = {Rubén Moreno-Aguado and Alba Magallón and Victor Moreno and Yingying Fang and Guang Yang},
journal= {arXiv preprint arXiv:2604.04133},
year = {2026}
}