中文

PLaID++: 用于定向无机材料设计的偏好对齐语言模型

机器学习 2025-12-23 v3 材料科学

摘要

从可验证奖励的强化学习 (RLVR) 已成为提高大语言模型正确性的有前景的方法,但在许多科学问题中,目标并非产生正确答案,而是产生满足一组约束条件的多样化候选方案。我们聚焦于材料生成中的这一挑战。为此,我们引入 PLaID++,一个在晶体生成中进行后训练的大语言模型,以实现稳定且受属性引导的晶体生成。我们发现,性能取决于我们的晶体学表示和奖励函数的 formulation。首先,我们引入一种紧凑且受对称性启发的 Wyckoff 文本表示,提高了计算效率,并鼓励从物理先验中进行泛化。其次,我们证明温度缩放充当熵正则器,抵消模式坍缩,鼓励探索。通过将对称约束直接编码到文本中,并引导模型输出朝向可取化学空间,PLaID++ 在较约方法的约 50% 时生成更稳定、独特且新颖的结构,并可条件生成具有所需空间群属性的结构。我们的工作表明,来自自然语言处理的后训练技术有潜力被适用于材料设计,为定向且高效的新材料发现之路。

关键词

引用

@article{arxiv.2509.07150,
  title  = {PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design},
  author = {Andy Xu and Rohan Desai and Larry Wang and Gabriel Hope and Ethan Ritz},
  journal= {arXiv preprint arXiv:2509.07150},
  year   = {2025}
}

备注

Code available at https://github.com/andaero/PLaID, model weights at https://huggingface.co/HOPE-Lab-HMC/PLaID