中文

基于推断时强化学习的开放材料生成

机器学习 2026-02-03 v1 材料科学

摘要

连续时间生成模型用于晶体材料能够通过学习预测稳定晶体结构来实现逆向材料设计,但将显式目标属性纳入生成过程仍具有挑战性。策略梯度强化学习 (RL) 提供了一种原则化的机制,用于将生成模型与下游目标对齐,但通常需要访问评分函数,这阻止了应用于仅学习速度场的流模型。我们提出了基于推断时强化学习的开放材料生成 (OMatG-IRL),这是一种直接作用于所学习速度场的策略梯度 RL 框架,无需显式计算评分。OMatG-IRL 利用对基本生成动力学的随机扰动,保持预训练生成模型的基线性能,同时在推断时实现探索和策略梯度估计。使用 OMatG-IRL,我们首次将 RL 应用于晶体结构预测 (CSP)。该方法在保持通过组成条件化实现的多样性的同时,有效地强化能量基准目标,性能与基于评分的 RL 方法相当。最后,我们表明 OMatG-IRL 能够学习时间依赖的速度退火方案,实现 CSP 采样效率提升数量级,相应地减少生成时间。

关键词

引用

@article{arxiv.2602.00424,
  title  = {Open Materials Generation with Inference-Time Reinforcement Learning},
  author = {Philipp Hoellmer and Stefano Martiniani},
  journal= {arXiv preprint arXiv:2602.00424},
  year   = {2026}
}

备注

16 pages, 8 figures, 1 table