中文

GenerateCT:基于文本条件生成三维胸部 CT 体数据

计算机视觉与模式识别 2024-07-15 v5

摘要

GenerateCT 是首个基于自由形式医学文本提示生成三维医学影像的方法,其包含一个文本编码器和三个关键组件:用于编码三维 CT 体数据的新型因果视觉 transformer、用于对齐 CT 与文本 token 的文本-图像 transformer,以及文本条件超分辨率扩散模型。由于在三维医学影像中无直接可比方法,我们将 GenerateCT 与前沿方法进行基准比较,证明其在所有关键指标上的优越性。重要的是,我们在多异常分类任务中评估了 GenerateCT 的临床应用。首先,我们在真实数据集上训练多异常分类器建立基线。为进一步评估模型对外部数据的泛化能力及在零样本场景下对未见提示的性能,我们使用外部集合训练分类器,设定了额外基准。我们进行了两个实验,使用 GenerateCT 为每个集合合成等量体数据从而使训练集翻倍。第一个实验表明,当分类器在真实与生成体数据上联合训练时,AP 分数提升 11%。第二个实验显示,基于未见提示在真实与生成体数据上训练时提升 7%。此外,GenerateCT 支持将合成训练数据集扩展到任意规模。例如,我们生成了 100,000 个三维 CT,为真实集合数量的五倍,并仅在这些合成 CT 上训练分类器。令人印象深刻的是,该分类器超越在所有可用真实数据上训练的分类器达 8%。最后,领域专家评估了生成的体数据,确认其与文本提示高度对齐。代码、模型权重、训练数据与生成数据见 https://github.com/ibrahimethemhamamci/GenerateCT

关键词

引用

@article{arxiv.2305.16037,
  title  = {GenerateCT: Text-Conditional Generation of 3D Chest CT Volumes},
  author = {Ibrahim Ethem Hamamci and Sezgin Er and Anjany Sekuboyina and Enis Simsar and Alperen Tezcan and Ayse Gulnihan Simsek and Sevval Nil Esirgun and Furkan Almas and Irem Dogan and Muhammed Furkan Dasdelen and Chinmay Prabhakar and Hadrien Reynaud and Sarthak Pati and Christian Bluethgen and Mehmet Kemal Ozdemir and Bjoern Menze},
  journal= {arXiv preprint arXiv:2305.16037},
  year   = {2024}
}