催化中吸附构型的多模态语言与图学习
计算工程、金融与科学
2024-10-15 v4
摘要
吸附能是一种反应性描述符,必须准确预测才能在催化剂筛选中有效应用机器学习 (ML)。此过程涉及确定催化表面上各种吸附构型的最低能量,这些构型可能表现出非常相似的能量值。虽然图神经网络 (GNN) 在计算催化剂系统能量方面取得了巨大成功,但它们严重依赖原子空间坐标。相比之下,基于 Transformer 的语言模型可以直接使用人类可读的文本输入,可能无需详细的原子位置。然而,这些语言模型在准确预测吸附构型能量方面常常遇到困难。我们的研究通过引入一种称为图辅助预训练的自监督多模态学习方法来解决这一局限性,该方法将成熟的 GNN 与新兴的语言模型应用连接起来。此方法将吸附构型能量预测的 MAE 降低了约 10%。此外,我们的发现表明,图辅助预训练增强了在不同数据集上的微调效果,表明该方法具有可迁移性。该方法还将模型的注意力重定向到吸附构型上,而不是单个吸附物和催化剂信息,这与常见的领域知识相似。在此基础上,我们提出使用生成式大语言模型,仅基于化学成分和表面取向来为预测模型创建文本输入,而不依赖精确的原子位置。这展示了语言模型在无几何信息情况下进行能量预测的一个潜在用例。
引用
@article{arxiv.2401.07408,
title = {Multimodal Language and Graph Learning of Adsorption Configuration in Catalysis},
author = {Janghoon Ock and Srivathsan Badrinarayanan and Rishikesh Magar and Akshay Antony and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2401.07408},
year = {2024}
}
备注
manuscript updated