面向定制化多模态脑部 MRI 生成的通用文本引导图像合成
图像与视频处理
2024-09-26 v1 计算机视觉与模式识别
摘要
多模态脑部磁共振成像在神经科学与神经病学中不可或缺。然而,由于 MRI 扫描仪的可及性及其漫长的采集时间,多模态 MR 图像通常难以获取。当前的 MR 图像合成方法通常针对特定任务在独立数据集上训练,导致在应用于新数据集和任务时性能欠佳。在此,我们提出 TUMSyn,一种文本引导的通用 MR 图像合成通用模型,该模型能够通过文本提示引导,从常规采集的扫描中灵活生成具有所需成像元数据的脑部 MR 图像。为确保 TUMSyn 图像合成的精度、多功能性与泛化能力,我们首先构建了一个脑部 MR 数据库,包含来自 13 个中心的 7 种 MRI 模态的 31,407 张 3D 图像。随后,我们使用对比学习预训练了一个 MRI 专用的文本编码器,以基于文本提示有效控制 MR 图像合成。在多样化数据集上的大量实验与医生评估表明,TUMSyn 能够在有监督和零样本场景下生成具有指定成像元数据的、具有临床意义的 MR 图像。因此,TUMSyn 可与已采集的 MR 扫描结合使用,促进基于 MRI 的大规模脑疾病筛查与诊断。
引用
@article{arxiv.2409.16818,
title = {Towards General Text-guided Image Synthesis for Customized Multimodal Brain MRI Generation},
author = {Yulin Wang and Honglin Xiong and Kaicong Sun and Shuwei Bai and Ling Dai and Zhongxiang Ding and Jiameng Liu and Qian Wang and Qian Liu and Dinggang Shen},
journal= {arXiv preprint arXiv:2409.16818},
year = {2024}
}
备注
23 pages, 9 figures