中文

深度生成模型通过视觉语言条件化揭示医学图像中的模式

计算机视觉与模式识别 2024-10-18 v1

摘要

深度生成模型通过提升数据集规模和质量,显著推动了医学影像分析。然而,本研究强调深度生成模型的另一重要能力:揭示医学图像中的模式。我们采用混合条件的生成结构,将临床数据和分割掩码组合用于引导图像合成。此外,我们创新性地将表格型临床数据转换为文本描述。该方法简化了缺失值的处理,也使我们能够利用大规模预训练视觉语言模型,探讨独立临床条目与一般术语(如性别和吸烟状态)之间的关系。我们的 approach 不同于且更具挑战性,因为临床信息与图像之间的视觉关联性较弱。为克服这一问题,我们引入文本-视觉嵌入机制以强化条件,确保网络有效利用所提供信息。我们的管道适用于 GAN 和扩散模型。在胸部 CT 实验中,尤其关注吸烟状态,结果显示肺部出现一致的强度变化,符合临床观察,表明该方法在捕捉和可视化特定属性对医学图像模式影响方面有效。我们的 methods 为利用深度生成模型实现复杂临床条件的早期检测和精确可视化提供了新途径。所有代码均为 https://github.com/junzhin/DGM-VLC。

关键词

引用

@article{arxiv.2410.13823,
  title  = {Deep Generative Models Unveil Patterns in Medical Images Through Vision-Language Conditioning},
  author = {Xiaodan Xing and Junzhi Ning and Yang Nan and Guang Yang},
  journal= {arXiv preprint arXiv:2410.13823},
  year   = {2024}
}

备注

Accepted by AIM-FM Workshop of NeurIPS2024