中文

GeMM-GAN:以组织病理学图像与临床描述为条件的基因表达谱生成多模态生成模型

人工智能 2026-01-23 v1 计算机视觉与模式识别 机器学习

摘要

生物医学研究日益依赖于整合多种数据模态,包括基因表达谱、医学图像和临床元数据。尽管医学图像和临床元数据在临床实践中被常规收集,但基因表达数据由于严格的隐私法规和高昂的实验成本,在广泛研究应用中面临独特挑战。为应对这些限制,我们提出 GeMM-GAN,一种以组织病理学组织切片和临床元数据为条件的新型生成对抗网络,旨在合成逼真的基因表达谱。GeMM-GAN 将用于图像块的 Transformer Encoder 与图像块和文本 token 之间的最终 Cross Attention 机制相结合,生成条件向量以引导生成模型生成生物学上连贯的基因表达谱。我们在 TCGA 数据集上评估了该方法,并证明我们的框架优于标准生成模型,生成了更逼真且功能上更有意义的基因表达谱,在下游疾病类型预测的准确率上较当前 SOTA 生成模型提高了 11% 以上。代码将发布于:https://github.com/francescapia/GeMM-GAN

关键词

引用

@article{arxiv.2601.15392,
  title  = {GeMM-GAN: A Multimodal Generative Model Conditioned on Histopathology Images and Clinical Descriptions for Gene Expression Profile Generation},
  author = {Francesca Pia Panaccione and Carlo Sgaravatti and Pietro Pinoli},
  journal= {arXiv preprint arXiv:2601.15392},
  year   = {2026}
}

备注

12 pages, 2 figures. Published at Image Analysis and Processing - ICIAP 2025 Workshops