在scGPT中发现造血流形:从生物基础模型内部提取高性能算法的方法
机器学习
2026-03-12 v1 细胞行为
基因组学
摘要
我们报告了从单细胞基础模型scGPT中发现并提取了一个紧凑的造血算法,据我们所知,这是第一个通过机制可解释性从基础模型中提取的、具有生物学用途且具有竞争力的算法。我们展示了scGPT内部编码了一个紧凑的造血流形,该流形具有显著的发育分支结构,并在严格的非重叠Tabula Sapiens外部面板上得到验证,并通过冻结头的零样本迁移到独立的多供体免疫面板得到确认。为了分离这种几何结构,我们引入了一个通用的三阶段提取方法,包括从冻结注意力权重中直接导出算子、一个轻量级的学习适配器以及一个任务特定的读出器,从而产生一个无需目标数据集重新训练的独立算法。在与scVI、Palantir、DPT、CellTypist、PCA和原始表达基线的88-分割供体保留基准测试中,提取的算法实现了最强的伪时间深度排序,并在关键亚型终点(CD4/CD8 AUROC 0.867,单核/巨噬细胞AUROC 0.951)上领先。与使用3层MLP对冻结的scGPT嵌入进行标准探测相比,提取的头在6/8个分类终点上具有BH显著性优势,同时完成完整的12分割评估活动速度快34.5倍,可训练参数少约1000倍。导出的算子从三个池化的注意力头压缩到一个头而没有统计显著性损失,并进一步压缩到秩-64的替代算子。对紧凑算子的机制可解释性揭示了一个集中的四因子核心,解释了66.2%的消融影响,这些因子分解为明确的T/淋巴样、B/浆细胞、粒细胞和单核/巨噬细胞基因程序。一个辅助的第二流形验证(细胞间通讯几何结构)证实了该提取方法超越了造血作用。
引用
@article{arxiv.2603.10261,
title = {Discovery of a Hematopoietic Manifold in scGPT Yields a Method for Extracting Performant Algorithms from Biological Foundation Model Internals},
author = {Ihor Kendiukhov},
journal= {arXiv preprint arXiv:2603.10261},
year = {2026}
}