中文

从基因名称、表达值和图像中学习:基于对比遮盖文本-图像预训练的空间转录组表征学习

计算机视觉与模式识别 2025-09-23 v1 人工智能

摘要

空间转录组学旨在将高分辨率组织学图像与空间分辨的基因表达相连接。为在下游任务上获得更好的性能,需要大规模预训练以获得通用表征,这些表征能够跨组织、实验室和协议桥接组织学和转录组。在空间转录组的跨模态预训练方法中,现有方法要么仅依赖基因名称,要么仅依赖表达值,均会剥离基因分支的关键语义,并破坏每个基因及其定量幅度之间的关联。此外,由于将监督限制在图像-文本对齐上,这些方法忽略了对学习稳健图像特征至关重要的内在视觉线索。我们提出了CoMTIP,即首个基于对比遮盖文本-图像预训练的框架,联合学习图像、基因名称和表达值,同时捕捉空间转录组的细粒度视觉上下文。视觉分支采用遮盖特征建模来重建遮盖的图像块并学习具有上下文感知的图像嵌入。文本分支应用可扩展的基因-文本编码器,平行处理所有基因句子,为每个基因及其数值值分配专用嵌入,并采用基于对偶的对抗训练(PAAT)以保持正确的基因-数值关联。在共享的InfoNCE优化空间中对齐图像和文本表征。在公共空间转录组数据集上的实验表明,CoMTIP不仅在多样化的下游任务上超越了先前方法,还实现了零样基因表达预测,这是现有方法无法提供的能力。

关键词

引用

@article{arxiv.2509.16892,
  title  = {Learning from Gene Names, Expression Values and Images: Contrastive Masked Text-Image Pretraining for Spatial Transcriptomics Representation Learning},
  author = {Jiahe Qian and Yaoyu Fang and Ziqiao Weng and Xinkun Wang and Lee A. Cooper and Bo Zhou},
  journal= {arXiv preprint arXiv:2509.16892},
  year   = {2025}
}

备注

9 pages, 3 figures