原子级基础模型中的信息路由:任务对齐与等变性如何塑造线性解缠
机器学习
2026-03-10 v2 人工智能
化学物理
摘要
决定分子属性预测模型其表示方式是否将几何信息与组成信息整洁分离的因素是什么?我们引入了组成探针分解(CPD),通过线性投影消除组成信号,并测量剩余几何信息对 Ridge 探针的可访问性。我们用四项独立检验验证了 CPD,其中之一是结构异构体基准测试:组成投影在该基准中得分与随机相同,而几何残差达到 94.6% 的两两分类准确率。在 QM9 数据集上,我们针对来自五个架构家族的十个模型进行了研究,发现存在一条\emph{线性可访问性梯度}:不同模型在组成消除后几何信息的可访问性相差 (HOMO-LUMO 间隙的 从 0.081 到 0.533)。解释这一梯度的三个因素:任务对齐占主导:在 HOMO-LUMO 间隙上训练的模型( 0.44--0.53)在体能训练的模型中表现更佳,两者相差约 0.25 的 。在两个独立架构上的结构消除实验也确认了这一点:PaiNN 在体能训练后下降到 0.31,MACE 下降到 0.08。数据多样性部分弥补了目标不对齐的缺陷,MACE 在 MPTraj 上预训练(0.36)优于仅在 QM9 上训练的能量模型。在 MACE 的表示中,信息按对称性类型路由:(向量)通道优先编码偶极矩( 对比 中的 0.38),而 (标量)通道编码 HOMO-LUMO 间隙( 对比 中的 0.34)。这一模式在 ViSNet 中不存在。我们还显示,非线性探针在残差化表示上会产生误导性结果,在纯组成目标上恢复 --,并建议在此场景下使用线性探针。
关键词
引用
@article{arxiv.2603.03155,
title = {Information Routing in Atomistic Foundation Models: How Task Alignment and Equivariance Shape Linear Disentanglement},
author = {Joshua Steier},
journal= {arXiv preprint arXiv:2603.03155},
year = {2026}
}