中文

ChemBERTa:面向分子性质预测的大规模自监督预训练

机器学习 2020-10-26 v2 计算与语言 化学物理 生物大分子

摘要

GNN 和化学指纹是表示分子以进行性质预测的主要方法。然而,在 NLP 中,Transformer 凭借其强大的下游任务迁移能力已成为表示学习的事实标准。与此同时,围绕 Transformer 的软件生态系统正在迅速成熟,HuggingFace 和 BertViz 等库实现了精简的训练与可视化检视。在这项工作中,我们通过我们的 ChemBERTa 模型对 Transformer 在分子性质预测任务上的系统性评估进行了最早的尝试之一。ChemBERTa 随预训练数据集规模良好扩展,在 MoleculeNet 上提供有竞争力的下游性能,并提供有用的基于注意力的可视化方式。我们的结果表明,Transformer 为分子表示学习与性质预测的未来工作提供了一条有前景的途径。为促进这些努力,我们发布了一个来自 PubChem 的 7700 万 SMILES 的精选数据集,适用于大规模自监督预训练。

关键词

引用

@article{arxiv.2010.09885,
  title  = {ChemBERTa: Large-Scale Self-Supervised Pretraining for Molecular Property Prediction},
  author = {Seyone Chithrananda and Gabriel Grand and Bharath Ramsundar},
  journal= {arXiv preprint arXiv:2010.09885},
  year   = {2020}
}

备注

Submitted to NeurIPS 2020 ML for Molecules Workshop