图生成模型材料科学中的外推边界:如何可以生长得更远?
材料科学
2026-02-11 v1 介观与纳米尺度物理
机器学习
原子与分子团簇
摘要
每种晶体材料生成模型都隐藏着一个关键结构尺寸,超出此尺寸其输出会悄然变得不可靠——我们将其称为外推边界。尽管这一边界对纳米材料设计具有直接影响,但从未被系统性地测量。我们引入了 RADII,一个半径解析的基准,包含约 75,000 个纳米晶体结构(55-11,298 原子),将半径作为连续的缩放旋钮,用于在无泄漏分割下从分布内到分布外的生成质量评估。RADII 提供了边界特定的诊断工具:按半径误差轮廓指向每个架构的扩展极限,表面-内部分解测试失败是否源于边界还是内部,以及跨指标失败序列揭示结构保真度的哪个方面首先破裂。对五种最先进的架构进行基准测试,我们发现:(i)所有模型在训练半径之外都以约 13% 的全局位置误差退化,但局部键稳健性在不同架构之间差异巨大——从接近零到超过 2 倍的崩溃;(ii)没有两个架构共享相同的失败序列,揭示边界是一个由模型家族塑造的多维表面;(iii)行为良好的模型遵循 α ≈ 1/3 的幂律缩放指数,其分布内拟合准确预测分布外误差,使其边界可量化预测。这些发现确立了输出规模作为几何生成模型的首要评估轴。该数据集和代码均可用 https://github.com/KurbanIntelligenceLab/RADII 获取。
引用
@article{arxiv.2602.09309,
title = {How Far Can You Grow? Characterizing the Extrapolation Frontier of Graph Generative Models for Materials Science},
author = {Can Polat and Erchin Serpedin and Mustafa Kurban and Hasan Kurban},
journal= {arXiv preprint arXiv:2602.09309},
year = {2026}
}