像素完美MegaMed:用于生成高分辨率医学图像的百万像素级视觉语言基础模型
图像与视频处理
2025-08-26 v2 计算机视觉与模式识别
摘要
医学图像合成因临床环境中复杂性和高分辨率细节要求而呈现独特挑战。传统的生成式架构,如生成对抗网络(GAN)或变分自编码器(VAE)在高分辨率图像生成方面表现出色,但在保持诊断所必需的精细细节方面存在困难。为此,我们引入了像素完美MegaMed(Pixel Perfect MegaMed),这是首个在1024×1024分辨率下合成图像的视觉语言基础模型。我们的方法针对超高分辨率医学图像生成,设计了多尺度变换器架构,能够同时保留全局解剖背景和局部图像级细节。通过针对医学术语和影像模态的视觉语言对齐技术,像素完美MegaMed在前所未有的分辨率水平上桥接了文本描述与视觉表征之间的差距。我们将模型应用于CheXpert数据集,展示了其从文本提示生成临床忠实胸片的能力。除了视觉质量,这些高分辨率合成图像在下游任务中也显示出价值,如分类,通过数据增强(尤其是在数据稀缺的情境下)可实现可衡量的性能提升。我们的代码已通过项目网站 https://tehraninasab.github.io/pixelperfect-megamed 公开。
引用
@article{arxiv.2507.12698,
title = {Pixel Perfect MegaMed: A Megapixel-Scale Vision-Language Foundation Model for Generating High Resolution Medical Images},
author = {Zahra TehraniNasab and Hujun Ni and Amar Kumar and Tal Arbel},
journal= {arXiv preprint arXiv:2507.12698},
year = {2025}
}