语言模型可直接以 XYZ、CIF 和 PDB 文件在三维空间中生成分子、材料与蛋白质结合位点
机器学习
2023-05-11 v1 定量方法
摘要
语言模型是分子设计的强大工具。当前主流范式是将分子图解析为易于训练的线性字符串表示。这种方法非常成功,但它仅限于可以用图完全表示的化学结构——如有机分子——而材料和生物分子结构(如蛋白质结合位点)需要更完整的表示,包括其原子在空间中的相对位置。在这项工作中,我们展示了语言模型无需任何架构修改、使用下一 token 预测训练,即可从各种显著不同的化学结构分布中在三维空间生成新颖且有效的结构。具体而言,我们证明直接在源自化学文件格式(如 XYZ 文件、晶体学信息文件(CIF)或蛋白质数据银行文件(PDB))的序列上训练的语言模型,可以直接在三维空间中生成分子、晶体和蛋白质结合位点。此外,尽管在化学文件序列上训练,语言模型仍取得了与使用图和图派生字符串表示的最先进(SOTA)模型以及其他领域特定的 3D 生成模型相当的性能。在此过程中,我们证明训练化学语言模型无需使用简化的分子表示——它们是强大的生成模型,能够直接在三维空间中探索非常不同结构的化学空间。
引用
@article{arxiv.2305.05708,
title = {Language models can generate molecules, materials, and protein binding sites directly in three dimensions as XYZ, CIF, and PDB files},
author = {Daniel Flam-Shepherd and Alán Aspuru-Guzik},
journal= {arXiv preprint arXiv:2305.05708},
year = {2023}
}