自条件去噪:原子表征学习的自监督方法
机器学习
2026-03-19 v1
摘要
大规模预训练在自然语言处理和计算机视觉中的成功催化了为物理科学开发类似的基础模型努力。然而,针对原子数据的预训练策略仍未得到充分探索。到目前为止,针对DFT力-能标签的大规模监督式预训练提供了最强的性能提升,超过了仅限于基态几何结构或单一原子数据域的自监督学习(SSL)方法。我们通过自条件去噪(SCD)来解决这些不足,该方法是一种对任意原子数据域(包括小分子、蛋白质、周期性材料和“非平衡”几何结构)具有 backbone 无关性的条件去噪重构目标。当控制backbone架构和预训练数据集时,SCD在下游基准测试中显著优于以前的SSL方法,并与监督式力-能预训练相当或更好。我们展示了,一个小巧快速的GNN可通过SCD预训练实现与更大模型在多个任务域中竞争或优于性能。我们的代码可在 https://github.com/TyJPerez/SelfConditionedDenoisingAtoms 获取。
引用
@article{arxiv.2603.17196,
title = {Self-Conditioned Denoising for Atomistic Representation Learning},
author = {Tynan Perez and Rafael Gomez-Bombarelli},
journal= {arXiv preprint arXiv:2603.17196},
year = {2026}
}