中文

单细胞基础模型的彻底电路映射揭示了大量冗余、重尾枢纽架构以及图层依赖的分化控制

机器学习 2026-03-13 v1

摘要

生物基础模型的机械可解释性研究过去依赖于选择性特征抽样、成对互动测试和观察轨迹分析。每一种方法都会引入系统性偏差。本文提出了三项实验,通过彻底电路追踪、higher order 组合消除和因果轨迹引导,揭示了 Geneformer 这一基于 transformer 的单细胞 foundation model 的工作原理。首先,对 layer 5 上全部 4065 个活跃稀疏自编码器 features 进行彻底追踪,得到 1393850 条显著的下游边缘,这是选择性抽样的 27 倍扩张。这发现了重尾枢纽分布,其中 1.8% 的 features 占据不成比例的连接,40% 的前 20 大枢纽 lacks 生物注释。这表明先前的选择性分析中存在系统性注释偏差。其次,跨 8 个 feature 三元组的三方组合消除显示,冗余度随互动阶数单调增加,三方比率为 0.59 而双方比率为 0.74,且无 synergy。这确认了该模型架构在所有测试阶数上都是亚可加的。第三项,基于轨迹引导的 feature 引导建立了 layer 位置与分化方向性之间的因果联系。L17 的晚 layer features 持续将细胞状态推向成熟,fraction positive 为 1.0;L0 和 L11 的 early 和 mid layer features 大多将细胞状态推 away from 成熟,fraction positive 范围为 0.00 到 0.58。综上,这些结果从相关性向因果证据推进,以揭示图层依赖的细胞状态控制机制。

关键词

引用

@article{arxiv.2603.11940,
  title  = {Exhaustive Circuit Mapping of a Single-Cell Foundation Model Reveals Massive Redundancy, Heavy-Tailed Hub Architecture, and Layer-Dependent Differentiation Control},
  author = {Ihor Kendiukhov},
  journal= {arXiv preprint arXiv:2603.11940},
  year   = {2026}
}