化学语言的大型编码器-解码器基础模型系列
机器学习
2025-07-18 v1 人工智能
化学物理
摘要
大规模预训练方法代表了化学语言模型的突破性进展。这些方法在属性预测和分子生成等任务中表现出色,通过在大规模无标签语料库上进行自监督学习来学习输入 token 的上下文化表示。典型做法是先在无标签数据上进行预训练,然后在特定任务上进行微调,减少对标注数据集的依赖,拓宽化学语言表示的理解范围。本文介绍了一套大规模编码器-解码器化学基础模型,预训练于来自 PubChem 的筛选后的 9100 万条 SMILES 样本,相当于 40 亿个分子 token。该基础模型支持各种复杂任务,包括量子属性预测,并提供两种主要变体(289M 和 )。我们在多个基准数据集上的实验表明,所提模型在各种任务上均能提供 SOTA 结果。我们还对嵌入空间的组合性进行了初步评估,以作为推理任务的前提条件。我们表明所得隐空间在少数样本学习能力方面优于 SOTA,且是可分离的。
引用
@article{arxiv.2407.20267,
title = {A Large Encoder-Decoder Family of Foundation Models For Chemical Language},
author = {Eduardo Soares and Victor Shirasuna and Emilio Vital Brazil and Renato Cerqueira and Dmitry Zubarev and Kristin Schmidt},
journal= {arXiv preprint arXiv:2407.20267},
year = {2025}
}
备注
14 pages, 3 figures, 14 tables