中文

生成式AI用于医疗多模态合成数据的系统综述:近期发展与挑战

机器学习 2025-03-05 v2 人工智能

摘要

本文提出了一项综合系统性综述,探讨了用于合成 various medical data types(包括成像数据(皮肤病理、乳房成像、超声、CT、MRI和X光)、文本、时间序列和表格数据(电子健康记录))的生成模型(GAN、VAE、DM和LLM)。与以往专注于单一医疗模态的综述不同,本研究涵盖了广泛的医疗数据模态并探讨了各种生成模型。我们的检索策略查询Scopus、PubMed和ArXiv等数据库,聚焦2021年1月至2023年11月的近期研究成果,排除综述和观点。该时期强调了超越GAN的Recent advancements,后者已广泛被涵盖。本综述揭示了三个关键方面的见解:(1)合成的应用与目的;(2)生成技术;(3)评估方法。它突出了临床上有效的合成应用,展示了合成数据在解决多样临床需求方面的潜力。虽然纳入类标签、分割掩码和图像翻译的条件模型十分常见,但在利用既有的临床知识和患者特定情境方面仍存在差距,这表明需要更具个人化的合成方法,并强调要针对医疗数据的独特特征来调整生成方法。此外,在合成数据仅用于数据增强之外的应用(如用于验证和评估下游医疗AI模型)方面仍存在显著差距。本综述发现,缺乏针对医学影像的标准化评估方法是临床应用的障碍, underscores the need for in-depth evaluation approaches, benchmarking, and comparative studies to promote openness and collaboration。

关键词

引用

@article{arxiv.2407.00116,
  title  = {Generative AI for Synthetic Data Across Multiple Medical Modalities: A Systematic Review of Recent Developments and Challenges},
  author = {Mahmoud Ibrahim and Yasmina Al Khalil and Sina Amirrajab and Chang Sun and Marcel Breeuwer and Josien Pluim and Bart Elen and Gokhan Ertaylan and Michel Dumontier},
  journal= {arXiv preprint arXiv:2407.00116},
  year   = {2025}
}