中文

从古典分子描述符构建的深度学习基础模型

机器学习 2026-02-11 v2 化学物理

摘要

快速准确的数据驱动分子性质预测是化学领域众多科学进步的关键。虽然深度学习方法近年受到广泛关注,但在实际应用中数据有限的基准测试中,仍无法超越经典机器学习方法。本研究通过 CheMeleon,一个参数规模为 O(1000 万) 的基础模型,弥合了这一差距,使其能够引导消息传递神经网络最终超越经典方法。评估于 Polaris 和 MoleculeACE 上的 58 个基准数据集,CheMeleon 在 Polaris 任务中实现 75% 的胜率,超越 Random Forest (68%)、fastprop (36%) 和 Chemprop (32%) 等基线方法,在 MoleculeACE 实验室中实现 97% 的胜率,超越 Random Forest (50%) 和其他基础模型。不同于依赖噪声实验数据或偏向量子力学模拟的常规预训练方法,CheMeleon 利用低噪声分子描述符学习丰富且高度可迁移的分子表征,为基础模型预训练提供了新的途径。

关键词

引用

@article{arxiv.2506.15792,
  title  = {Deep Learning Foundation Models from Classical Molecular Descriptors},
  author = {Jackson W. Burns and Akshat Shirish Zalte and Charlles R. A. Abreu and Jochen Sieg and Christian Feldmann and Miriam Mathea and William H. Green},
  journal= {arXiv preprint arXiv:2506.15792},
  year   = {2026}
}