中文

VAP-Diffusion:用于增强医学图像生成的视觉属性提示

计算机视觉与模式识别 2025-07-01 v1 人工智能

摘要

由于医学图像的外观受到多个潜在因素的影响,生成模型需要除标签之外的丰富属性信息才能生成真实且多样的图像。例如,生成具有特定图案的皮肤瘤图像需要超越诊断的描述,如形状、大小、纹理和颜色。然而,这类详细描述并不总是可用。为此,我们探索了一种称为视觉属性提示(VAP)-Diffusion的框架,以利用预训练的多模态大语言模型(MLLMs)的外部知识来提高医学图像生成的质量和多样性。首先,为避免幻觉,我们设计了一系列遵循链式思考的提示,用于常见的医学成像任务,包括皮肤科、结肠和胸部X光图像。生成的描述用于训练期间存储并在不同类别中保存。在测试期间,随机检索相应类别的描述用于推理。此外,为使生成器对测试时未见的描述组合保持鲁健性,我们提出了一种原型条件机制,将测试嵌入限制为与训练嵌入相似。在三个常见医学成像类型上的四个数据集上的实验验证了VAP-Diffusion的有效性。

关键词

引用

@article{arxiv.2506.23641,
  title  = {VAP-Diffusion: Enriching Descriptions with MLLMs for Enhanced Medical Image Generation},
  author = {Peng Huang and Junhu Fu and Bowen Guo and Zeju Li and Yuanyuan Wang and Yi Guo},
  journal= {arXiv preprint arXiv:2506.23641},
  year   = {2025}
}