中文

化学发现中可迁移机器学习模型的表示与策略

化学物理 2022-03-14 v1 材料科学 机器学习

摘要

跨材料组成空间通用的机器学习(ML)加速发现策略至关重要,但 ML 的演示主要局限于狭窄的组成变化。通过解决化学空间中具有挑战性的目标(如开壳层过渡金属配合物)在前景区域的数据稀缺问题,利用现有数据中已知关系的通用表示和可迁移 ML 模型将加速发现。在一 large 集合(约 1000)的等价电子过渡金属配合物上,我们量化了不同性质(即自旋分裂和配体解离)在元素周期表各行(即 3d/4d 金属和 2p/3p 配体)之间明显的关系。我们展示了对基于图的修正自相关(RAC)表示(即 eRAC)的扩展,该表示将有效核电荷与核电荷启发式一并纳入,而后者会高估等价电子配合物的相异度。为解决新空间中数据有限这一常见发现难题,我们引入了一种迁移学习方法:用来自元素周期表某一行的大量数据训练模型,并以来自另一行的小量数据点作为种子。我们展示了 eRAC 与此迁移学习策略的协同价值,可一致地改进模型性能。对这些模型的分析凸显了该方法是如何通过重排配合物间距离使其与元素周期表更一致而成功的,我们预期这一性质对其他材料领域也具有广泛用处。

关键词

引用

@article{arxiv.2106.10768,
  title  = {Representations and Strategies for Transferable Machine Learning Models in Chemical Discovery},
  author = {Daniel R. Harper and Aditya Nandy and Naveen Arunachalam and Chenru Duan and Jon Paul Janet and Heather J. Kulik},
  journal= {arXiv preprint arXiv:2106.10768},
  year   = {2022}
}