中文

少即是多:利用主动学习采样化学空间

计算物理 2018-05-25 v2 机器学习 化学物理 机器学习

摘要

开发用于预测分子能量学的准确且可迁移的机器学习 (ML) 势是一项具有挑战性的任务。用于训练此类 ML 势的数据生成过程既未被充分理解,也缺乏详细研究。本工作中,我们提出一种全自动的数据集生成方法,旨在训练通用 ML 势。它基于通过委员会查询 (QBC) 的主动学习 (AL) 概念,利用 ML 势集成之间的分歧来推断该集成预测的可信度。QBC 使所提出的 AL 算法能够自动采样 ML 势无法准确预测势能的化学空间区域。AL 通过在决定使用何种新训练数据时减轻人类偏见,在严格测试用例中改善了 ANAKIN-ME (ANI) 深度学习势的整体适用性。AL 还将训练集规模缩减至使用朴素随机采样技术所需数据的一小部分。为验证我们的 AL 方法,我们开发了 COMP6 基准(在 GitHub 上公开可用),其包含一组多样的有机分子。通过 AL 过程表明,基于 AL 的势仅用 10% 的数据即在 COMP6 上表现与 ANI-1 势相当,并在使用 25% 数据量时大幅优于 ANI-1。最后,我们展示所提 AL 技术开发了通用 ANI 势 (ANI-1x),可对全部 COMP6 基准提供准确的能量与力预测。该通用 ML 势在由 CHNO 元素构成的有机分子一般类上达到与最佳单分子或材料 ML 势相当的精度,同时保持适用性。

关键词

引用

@article{arxiv.1801.09319,
  title  = {Less is more: sampling chemical space with active learning},
  author = {Justin S. Smith and Ben Nebgen and Nicholas Lubbers and Olexandr Isayev and Adrian E. Roitberg},
  journal= {arXiv preprint arXiv:1801.09319},
  year   = {2018}
}

备注

Accepted at J. Chem. Phys