中文

语言模型赋能数据增强的无机材料合成规划

材料科学 2025-06-17 v1 机器学习 机器学习

摘要

无机合成规划目前主要依赖启发式方法或基于有限数据集训练的机器学习模型,这限制了其通用性。我们证明语言模型无需任务特定微调即可回忆合成条件。GPT-4.1、Gemini 2.0 Flash 和 Llama 4 Maverick 等现成模型在 1,000 个反应的保留集上实现了高达 53.8% 的 Top-1 前体预测准确率和 66.1% 的 Top-5 性能。它们还能以低于 126°C 的平均绝对误差预测煅烧温度和烧结温度,与专门的回归方法相当。集成这些语言模型进一步提升了预测准确率,并将每次预测的推理成本降低高达 70%。随后,我们利用语言模型生成了 28,548 个合成反应配方,将其与文献挖掘的示例结合以预训练基于 Transformer 的模型 SyntMTE。在联合数据集上微调后,SyntMTE 将烧结温度预测的平均绝对误差降至 73°C,煅烧温度降至 98°C。该策略相比仅使用实验数据训练的基线模型将性能提升了高达 8.7%。最后,在 Li7La3Zr2O12 固态电解质的案例研究中,我们证明 SyntMTE 重现了实验观察到的掺杂剂依赖烧结趋势。我们的混合工作流实现了可扩展、数据高效的无机合成规划。

关键词

引用

@article{arxiv.2506.12557,
  title  = {Language Models Enable Data-Augmented Synthesis Planning for Inorganic Materials},
  author = {Thorben Prein and Elton Pan and Janik Jehkul and Steffen Weinmann and Elsa A. Olivetti and Jennifer L. M. Rupp},
  journal= {arXiv preprint arXiv:2506.12557},
  year   = {2025}
}