中心到局部自适应生成扩散框架用于提升数据受限空间转录组学中的基因表达预测
机器学习
2026-03-31 v1 人工智能
计算机视觉与模式识别
摘要
空间转录组学(ST)能够在完整的组织结构中提供具有空间分辨率的基因表达谱,从而实现组织学背景下的分子分析。然而,ST实验的高成本、低通量和受限的数据共享导致严重的数据稀缺,限制了稳健计算模型的开发。为解决这一限制,我们提出了一种用于ST的中心到局部自适应生成扩散框架(C2L-ST),它将大规模形态学先验与有限的分子指导相结合。首先,一个全局中心模型在广泛病理学数据集上预训练以学习可迁移的形态学表示,然后通过使用少量配对的图像-基因点进行轻量级基因条件调节来适配特定机构的局部模型。该策略能够在数据受限条件下合成真实且分子一致的组织学图像块。生成的图像表现出高视觉和结构保真度,重现细胞组成,并在多个器官中与真实数据表现出强烈的嵌入重叠,反映了真实性和多样性。当并入下游训练时,合成的图像-基因对提高了基因表达预测的准确性和空间一致性,在仅需要少量采样点的情况下达到了与真实数据相当的性能。C2L-ST为分子层面的数据增强提供了一个可扩展且数据高效的框架,为在空间生物学及相关领域整合组织学和转录组学提供了一种领域自适应和可泛化的方法。
引用
@article{arxiv.2603.26827,
title = {Central-to-Local Adaptive Generative Diffusion Framework for Improving Gene Expression Prediction in Data-Limited Spatial Transcriptomics},
author = {Yaoyu Fang and Jiahe Qian and Xinkun Wang and Lee A. Cooper and Bo Zhou},
journal= {arXiv preprint arXiv:2603.26827},
year = {2026}
}
备注
31 pages, 12 figures, under review