通过层次化预训练从解剖学到疾病表型构建通用 CT 表示
计算机视觉与模式识别
2026-05-25 v2
摘要
CT 是三维医学成像的核心内容,但 CT 基于的人工智能在分割、分类、配准和报告分析等任务-specific 模型之间仍然碎片化。本文提出 FlexiCT,一套通过在 266,227 个 CT 体积上进行层次化持续预训练得到的 CT 基础模型家族,这些体积来自 56 个公开数据集,构成了规模庞大的 CT 表示学习公共资源。FlexiCT 使用三阶段的层次化预训练:二维轴向预训练、三维解剖预训练和报告引导的语义对齐。该训练策略支持切片级、体积级和视觉-语言分析。在五个下游任务家族(分割、分类、配准、视觉-语言理解和临床检索)上,FlexiCT 在多个基准测试中与先前的 task-specific 方法相当或更好。其嵌入表示沿着与各种肿瘤阶段相关的梯度组织 CT 扫描,表明 CT 基础模型能够捕捉与疾病表型特征相关的成像特征。项目页面和代码均可在 https://ricklisz.github.io/flexict.github.io 和 https://github.com/ricklisz/FlexiCT 查看。
引用
@article{arxiv.2605.21906,
title = {Universal CT Representations from Anatomy to Disease Phenotype through Agglomerative Pretraining},
author = {Yuheng Li and Yuan Gao and Haoyu Dong and Yuxiang Lai and Shansong Wang and Mojtaba Safari and James E. Baciak and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2605.21906},
year = {2026}
}