Med-Art:面向 2D 医学文本到图像生成的扩散 Transformer
计算机视觉与模式识别
2025-06-26 v1
摘要
文本到图像生成模型在近年来取得了显著的突破,但在医学图像生成领域仍面临数据集较小、医学文本数据稀缺等显著挑战。为此,我们提出 Med-Art,一个专为医学图像生成设计的框架,能够在数据有限的情况下实现高性能。Med-Art 利用视觉语言模型生成医学图像的视觉描述,克服了适用医学文本数据稀缺的瓶颈。Med-Art 基于扩散 Transformer (DiT) 架构,继承了大规模预训练文本到图像模型 PixArt- 的能力,在有限数据下实现卓越性能。此外,我们提出一种创新的混合层次扩散微调 (HLDF) 方法,使像素级损失得以有效应用,解决了颜色过度饱和等问题。我们在两个医学图像数据集上实现了最先进的性能,评估指标包括 FID、KID 以及下游分类性能。
引用
@article{arxiv.2506.20449,
title = {Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation},
author = {Changlu Guo and Anders Nymark Christensen and Morten Rieger Hannemose},
journal= {arXiv preprint arXiv:2506.20449},
year = {2025}
}
备注
The project is available at \url{https://medart-ai.github.io}