中文

GPT-MolBERTa:用于分子性质预测的GPT分子特征语言模型

化学物理 2023-10-11 v3 机器学习

摘要

随着 Transformer 架构的出现及其对文本数据的强大理解能力,基于文本描述预测分子性质的新视野已然开启。虽然 SMILES 是最常用的表示形式,但它们缺乏鲁棒性、丰富信息和规范性,这限制了它们作为可泛化表示的有效性。在此,我们提出 GPT-MolBERTa,一种使用分子详细文本描述来预测其性质的自监督大语言模型(LLM)。使用 ChatGPT 收集了 326000 个分子的基于文本的描述,并用于训练 LLM 以学习分子的表示。为预测下游任务的性质,在微调阶段使用了 BERT 和 RoBERTa 模型。实验表明,GPT-MolBERTa 在各种分子性质基准上表现良好,并在回归任务中接近最先进性能。此外,对注意力机制的进一步分析显示,GPT-MolBERTa 能够从输入文本数据中获取重要信息,展示了模型的可解释性。

关键词

引用

@article{arxiv.2310.03030,
  title  = {GPT-MolBERTa: GPT Molecular Features Language Model for molecular property prediction},
  author = {Suryanarayanan Balaji and Rishikesh Magar and Yayati Jadhav and Amir Barati Farimani},
  journal= {arXiv preprint arXiv:2310.03030},
  year   = {2023}
}

备注

Paper has 17 pages, 4 figures and 4 tables, along with 71 references