中文

将预训练模型表示作为机器学习原子间势主动学习的获取信号

机器学习 2026-05-18 v2 化学物理

摘要

为反应化学训练机器学习原子间势(MLIPs)往往受限于量子化学标签的高昂成本以及候选池中过渡态构型的稀缺。主动学习(AL)可以缓解这些成本,但其有效性取决于获取规则。我们研究了预训练 MLIP 的潜在空间是否已经包含了有效获取所需的信息,从而无需辅助不确定性头、贝叶斯训练与微调或委员会集成。我们引入了直接从预训练 MACE 势导出的两种获取信号:一个有限宽度的神经正切核(NTK)和一个由隐藏潜在空间特征构建的激活核。在反应化学基准测试中,这两个核的表现始终优于固定描述符基线、委员会分歧和随机获取,使达到性能目标所需的数据量平均减少了 38%(能量误差)和 28%(力误差)。我们进一步表明,预训练模型诱导的相似空间保留了化学上有意义的结构,并提供了比随机初始化或基于固定描述符的核更可靠的残差不确定性估计。我们的结果表明,预训练使潜在空间几何与模型误差对齐,为反应 MLIP 微调提供了实用且充分的获取信号。

关键词

引用

@article{arxiv.2605.03964,
  title  = {Pretrained Model Representations as Acquisition Signals for Active Learning of MLIPs},
  author = {Eszter Varga-Umbrich and Shikha Surana and Paul Duckworth and Jules Tilly and Olivier Peltre and Zachary Weller-Davies},
  journal= {arXiv preprint arXiv:2605.03964},
  year   = {2026}
}

备注

8 main pages, 28 total pages