中文

TAP-CT:计算断层扫描的 3D 任务无关性预训练

计算机视觉与模式识别 2025-12-02 v1 人工智能

摘要

现有的医学领域基础模型 (Foundation Model) 往往需要大量微调,或依赖资源密集的解码器,而许多现有编码器是针对特定任务偏置的进行预训练。这表明迫切需要一种强大且任务无关的基础模型,仅需进行特征提取即可实现最小化的微调。在本工作中,我们引入了一套用于计算断层扫描 (CT) 基础模型的任务无关性预训练方法 (TAP-CT):一种简单而有效的 Vision Transformer (ViT) 和 DINOv2 体积数据适应方案,使其能够直接在 3D CT 体数据上进行可扩展的自监督预训练。我们的方案包含针对 patch 嵌入、位置编码和体积数据增强的针对性修改,使该架构具有深度感知优势,同时保持底层架构的简单性。我们展示, 在拥有 105K 个体积数据集的大规模 3D 预训练可获得稳定、稳健的冻结特征表示,并且在下游任务上具有强大的泛化能力。为促进透明度和可重复性,并为医学影像领域的未来研究建立一个强大且资源有限的基准,我们将在 https://huggingface.co/fomofo/tap-ct-b-3d 上发布所有预训练模型、实验配置以及下游基准代码。

关键词

引用

@article{arxiv.2512.00872,
  title  = {TAP-CT: 3D Task-Agnostic Pretraining of Computed Tomography Foundation Models},
  author = {Tim Veenboer and George Yiasemis and Eric Marcus and Vivien Van Veldhuizen and Cees G. M. Snoek and Jonas Teuwen and Kevin B. W. Groot Lipman},
  journal= {arXiv preprint arXiv:2512.00872},
  year   = {2025}
}

备注

22 pages, 4 figures, 8 tables