中文

生物基础模型学习到的拓扑与几何结构是什么?基于141个假设的证据

定量方法 2026-03-09 v2 机器学习 基因组学

摘要

当生物基础模型如scGPT和Geneformer处理单细胞基因表达数据时,其内部表示中形成何种几何与拓扑结构?这种结构是生物学上有意义还是训练副产品,以及我们应对此类主张持何种信心?我们通过自主的大规模假设筛选来回答这些问题:一个由AI驱动的执行者-构思者循环提出、测试和细化了141个涵盖持久同调、流形距离、跨模型对齐、社区结构和定向拓扑的几何与拓扑假设,所有假设均包含明确的零假设控制和不相交的基因池分割。三个主要发现浮现。首先,模型学习到了真实的几何结构。基因嵌入邻域呈现出非平凡的拓扑结构,在最弱的领域中,持久同调在11个中的12个Transformer层中显著(p<0.05),在另外两个领域中则全部12个均显著。多层距离层次显示,流形感知的度量优于欧几里得距离用于识别调控基因对,图社区分区跟踪已知的转录因子靶标关系。其次,这种结构在独立训练的模型之间共享。scGPT与Geneformer之间的CCA对齐实现了0.80的典型相关性和72%的基因检索准确率,但其中19个测试方法中没有一个可靠地恢复基因级别的对应关系。模型在基因空间的全局形状上达成一致,但在具体基因定位上不一致。第三,结构比最初呈现的更局部化。在严格的零假设控制下,稳健信号集中在免疫组织,而肺部和外部肺信号显著减弱。

关键词

引用

@article{arxiv.2602.22289,
  title  = {What Topological and Geometric Structure Do Biological Foundation Models Learn? Evidence from 141 Hypotheses},
  author = {Ihor Kendiukhov},
  journal= {arXiv preprint arXiv:2602.22289},
  year   = {2026}
}