TotalFM:面向3D-CT视觉基础模型的器官分离框架
计算机视觉与模式识别
2026-01-05 v1
摘要
尽管视觉基础模型在放射学中预期将被用于各种临床任务,但在训练3D-CT体数据时仍面临计算成本瓶颈。本研究提出TotalFM,一种基于器官分离概念的放射学基础模型,高效学习3D-CT图像与语言表达之间的对应关系,基于14万序列的大规模数据集。通过自动化的器官体积与 finding-句子配对创建流程(采用分割技术与大语言模型处理放射报告),结合基于VideoMAE的自监督预训练与基于体积-文本对的对比学习,旨在计算效率与表示能力之间取得平衡。在零样本器官级病灶分类任务中,所提模型在83%(5/6)个器官上相对于CT-CLIP,在83%(9/14)个器官上相对于Merlin实现更高F1分数。这些结果表明,该模型在使用真实放射报告句子进行临床评估时,展现出高水平的泛化性能。在零样本 finding 级病灶分类任务中,我们的模型在83%(25/30)个 finding 类别上相对于Merlin实现更高AUROC。我们还确认了在放射报告生成任务中与现有视觉-语言模型(VLM)相当的性能。我们的结果表明,器官分离学习框架可作为实用且有效的3D-CT基础模型实现指南。
引用
@article{arxiv.2601.00260,
title = {TotalFM: An Organ-Separated Framework for 3D-CT Vision Foundation Models},
author = {Kohei Yamamoto and Tomohiro Kikuchi},
journal= {arXiv preprint arXiv:2601.00260},
year = {2026}
}