中文

CTFlow:基于视频启发的 3D CT 合成潜在流匹配

计算机视觉与模式识别 2025-08-19 v1 人工智能

摘要

条件于临床报告生成整个 CT 体积的生成式建模有望通过数据增强、隐私保护的合成以及减少患者数据上的监管约束来加速研究,同时保留诊断信号。近期发布的 CT-RATE 数据库提供了大规模的 3D CT 体积及其相应临床报告的配对数据,使训练大规模文本条件 CT 体积生成模型变得可行。本文介绍了 CTFlow,一个 0.5B 参数的潜在流匹配变换器模型,基于临床报告进行条件化。我们采用 FLUX 中的 A-VAE 构建潜在空间,依赖 CT-Clip 文本编码器对临床报告进行编码。为在保持内存约束可行的同时生成一致的整个 CT 体积,我们采用自定义的自回归方法,该模型首先从文本-only 生成体积的第一个切片序列,然后利用已生成的切片序列和文本预测后续切片序列。我们对结果进行评估,与最先进的生成式 CT 模型进行比较,展示了在时序一致性、图像多样性和文本-图像对齐方面的优势,采用 FID、FVD、IS 分数和 CLIP 分数进行衡量。

关键词

引用

@article{arxiv.2508.12900,
  title  = {CTFlow: Video-Inspired Latent Flow Matching for 3D CT Synthesis},
  author = {Jiayi Wang and Hadrien Reynaud and Franciskus Xaverius Erick and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2508.12900},
  year   = {2025}
}