GPT-MolBERTa:用于分子性质预测的GPT分子特征语言模型
化学物理
2023-10-11 v3 机器学习
摘要
随着 Transformer 架构的出现及其对文本数据的强大理解能力,基于文本描述预测分子性质的新视野已然开启。虽然 SMILES 是最常用的表示形式,但它们缺乏鲁棒性、丰富信息和规范性,这限制了它们作为可泛化表示的有效性。在此,我们提出 GPT-MolBERTa,一种使用分子详细文本描述来预测其性质的自监督大语言模型(LLM)。使用 ChatGPT 收集了 326000 个分子的基于文本的描述,并用于训练 LLM 以学习分子的表示。为预测下游任务的性质,在微调阶段使用了 BERT 和 RoBERTa 模型。实验表明,GPT-MolBERTa 在各种分子性质基准上表现良好,并在回归任务中接近最先进性能。此外,对注意力机制的进一步分析显示,GPT-MolBERTa 能够从输入文本数据中获取重要信息,展示了模型的可解释性。
引用
@article{arxiv.2310.03030,
title = {GPT-MolBERTa: GPT Molecular Features Language Model for molecular property prediction},
author = {Suryanarayanan Balaji and Rishikesh Magar and Yayati Jadhav and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2310.03030},
year = {2023}
}
备注
Paper has 17 pages, 4 figures and 4 tables, along with 71 references