ChemBERTa-2:迈向化学基础模型
机器学习
2022-09-07 v1 人工智能
生物大分子
摘要
GPT-3 等大型预训练模型通过利用自监督学习来学习显著表征,并可轻易微调用于广泛下游任务,对现代自然语言处理产生了巨大影响。我们探究通过将此类进展迁移至分子机器学习的可能性,使用 SMILES 语言构建化学基础模型 ChemBERTa-2。尽管分子预测任务的标注数据通常稀缺,但 SMILES 字符串库易于获取。本工作中,我们在 ChemBERTa 基础上优化预训练过程。我们通过变化超参数与预训练数据集规模(最多来自 PubChem 的 77M 化合物),比较多任务与自监督预训练。据我们所知,77M 数据集是迄今用于分子预训练的最大数据集之一。我们发现,借助这些预训练改进,我们在 MoleculeNet 基准套件上可与现有最先进架构竞争。我们分析了预训练改进向下游任务改进转化的程度。
引用
@article{arxiv.2209.01712,
title = {ChemBERTa-2: Towards Chemical Foundation Models},
author = {Walid Ahmad and Elana Simon and Seyone Chithrananda and Gabriel Grand and Bharath Ramsundar},
journal= {arXiv preprint arXiv:2209.01712},
year = {2022}
}
备注
ELLIS Machine Learning for Molecule Discovery Workshop