基于延迟奖励的学习——以二维材料逆向缺陷设计为例
材料科学
2021-08-16 v1
摘要
材料中的缺陷动力学对从催化、储能系统到微电子等广泛技术具有核心重要性。材料功能强烈依赖于缺陷的性质与组织方式,其排列常涉及中间态或瞬态,这些状态对转变构成高势垒。对这些中间态认知的缺乏以及该能量势垒的存在,给逆向缺陷设计(尤其是基于梯度的方法)带来了严峻挑战。在此,我们提出一种基于延迟奖励的强化学习(蒙特卡洛树搜索),其能够高效搜索缺陷构型空间,并使我们得以识别低维材料中的最优缺陷排列。以二维 MoS2 这一代表性案例,我们证明延迟奖励的使用使我们能够高效采样缺陷构型空间,并在宽泛的缺陷浓度范围(从 1.5% 到 8% 的 S 空位)内克服能量势垒,系统从初始随机分布的 S 空位演化为具有扩展 S 线缺陷的构型,这与先前的实验研究一致。在特征空间中的详细分析使我们能够识别该缺陷转变与排列的最优路径。与遗传算法等其他全局优化方案相比,采用延迟奖励的 MCTS 所需评估次数更少,且解的质量更优。我们讨论了所采样的各种缺陷构型对 MoS2 中 2H 到 1T 相变的影响。总体而言,我们引入了一种采用延迟奖励的强化学习(RL)策略,可加速材料中缺陷的逆向设计以实现目标功能。
引用
@article{arxiv.2106.10557,
title = {Learning with Delayed Rewards -- A case study on inverse defect design in 2D materials},
author = {Suvo Banik and Troy D Loeffler and Rohit Batra and Harpal Singh and Mathew Cherukara and Subramanian KRS Sankaranarayanan},
journal= {arXiv preprint arXiv:2106.10557},
year = {2021}
}