中文

CrystalGym:面向材料发现的强化学习新基准

机器学习 2025-09-30 v1

摘要

面向新材料的原位设计与优化主要依赖高精度的原子模拟器,执行密度泛函理论(DFT)计算。虽然近期研究展示了机器学习在加速材料设计过程中具有巨大潜力,但这些方法大多为生成式方法,由于DFT计算成本高昂,未能将直接的DFT信号作为反馈来改进训练和生成。为通过在线强化学习(RL)促进直接DFT信号在材料设计循环中的应用,我们提出了CrystalGym——一个用于晶体材料发现的开源RL环境。使用CrystalGym,我们对常见的基于价值和基于策略的强化学习算法进行了基准测试,用于在给定目标属性的条件下设计各种晶体。具体而言,我们针对.band gap、体模量和密度等具有挑战性的属性进行优化,这些属性在环境中直接由DFT计算得出。尽管我们基准测试的算法未能解决所有CrystalGym任务,但我们的大量实验和消融实验显示,不同算法和环境设置在不同样本效率和收敛至最优的便利性方面存在差异。此外,我们还包括了大型语言模型通过强化学习进行微调以提高DFT基准奖励的案例研究。我们的目标是让CrystalGym成为强化学习研究人员和材料科学家解决实际设计问题(具有实际应用)的测试平台。因此,我们引入了一类面向强化学习方法的新挑战,处理耗时的奖励信号,为以机器学习为导向的真实世界应用推动未来跨学科研究铺平了道路。

关键词

引用

@article{arxiv.2509.23156,
  title  = {CrystalGym: A New Benchmark for Materials Discovery Using Reinforcement Learning},
  author = {Prashant Govindarajan and Mathieu Reymond and Antoine Clavaud and Mariano Phielipp and Santiago Miret and Sarath Chandar},
  journal= {arXiv preprint arXiv:2509.23156},
  year   = {2025}
}