中文

科学基础模型中物质表征的普遍收敛性

机器学习 2025-12-04 v1 材料科学

摘要

正在训练各种模态和架构的机器学习模型,以预测分子、材料和蛋白质的行为。然而,是否它们学习了相似的物质内部表征仍不清楚。理解其潜在结构对于构建能够可靠地在训练领域之外泛化的科学基础模型至关重要。尽管在语言和视觉领域已观察到表征收敛,但其在科学领域的对应现象尚未系统探讨。本文表明,几乎六十个科学模型——涵盖字符串、图结构、三维原子和蛋白质等模态——在广泛化学系统上的表征高度一致。针对不同数据集训练的模型对小分子表征高度相似,机器学习原子势模型随性能提升在表征空间中收敛,表明基础模型学习了对物理现实的共同底层表征。随后我们指出两种科学模型的不同 regime:在输入类似训练期间的情形下,高性能模型在表征空间中彼此对齐,而弱模型收敛至局部亚最优;在与训练期间截然不同的结构输入下,几乎所有模型在表征空间中坍缩为低信息表征,表明当今模型仍受限于训练数据和归纳偏置,尚未编码出真正的通用结构。我们的发现确立了表征对齐作为基础层普适性的量化基准。更广泛地说,我们的工作可追踪随模型规模增长而通用物质表征的出现,并用于选择和提炼其学习表征在不同模态、物质领域和科学任务之间迁移性能最佳的模型。

关键词

引用

@article{arxiv.2512.03750,
  title  = {Universally Converging Representations of Matter Across Scientific Foundation Models},
  author = {Sathya Edamadaka and Soojung Yang and Ju Li and Rafael Gómez-Bombarelli},
  journal= {arXiv preprint arXiv:2512.03750},
  year   = {2025}
}

备注

Oral spotlight at NeurIPS 2025 UniReps Workshop