GeneMamba:基于单细胞数据的高效且有效的基础模型
计算与语言
2026-03-25 v4 机器学习
基因组学
摘要
单细胞 RNA 测序 (scRNA-seq) 使高分辨率分析细胞异质性成为可能,但其复杂性——尤其是高维度、稀疏性和批次效应——构成了主要计算挑战。基于转换器的模型在此领域取得了显著进展,但常受限于其二次复杂度和次优处理长程依赖的问题。本文引入 GeneMamba,一个基于状态空间建模构建的面向单细胞转录组的可扩展且高效的基础模型。借助 Bi-Mamba 架构,GeneMamba 捕获双向基因上下文,实现线性时间复杂度,相对于转换器基线方法具有显著的计算优势。该模型在近 3000 万细胞上进行预训练,并包含生物学上有信息的目标,包括通路感知对比损失和基于排名的基因编码。我们在 diverse 任务上评估 GeneMamba,包括多批次集成、细胞类型标注和基因-基因相关性,展示了强大的性能、可解释性和鲁棒性。这些结果将 GeneMamba 定位为转换器方法的实际且强大的替代方案,推动了面向大规模单细胞数据分析的以生物学为导向的可扩展工具的发展。
引用
@article{arxiv.2504.16956,
title = {GeneMamba: An Efficient and Effective Foundation Model on Single Cell Data},
author = {Cong Qi and Hanzhang Fang and Siqi Jiang and Xun Song and Tianxing Hu and Wei Zhi},
journal= {arXiv preprint arXiv:2504.16956},
year = {2026}
}