基于信息化化合物构建的 ChemFM:一种遵循规模定律的基础模型预训练方法
计算工程、金融与科学
2025-11-06 v3
摘要
传统 AI 方法往往依赖于特定任务的模型设计和训练,这限制了模型规模的可扩展性以及在不同任务之间的泛化能力。我们引入 ChemFM,这是一个专为化学领域开发的大型基础模型。通过进行一系列规模实验,我们确定 UniChem 作为预训练基础模型的最佳信息化分子数据库。ChemFM 包含 30 亿参数,采用自监督因果语言建模在 1.78 亿分子上进行预训练,以提取可泛化的分子表征。该模型可通过全参数或参数高效 fine-tuning 方法适应于多样化的下游化学应用。ChemFM 在所有测试任务中均 consistently 优于最新的 task-specific AI 模型。值得注意的是,它在 34 个性质预测基准任务中实现了最高可达 67.48% 的性能提升,在条件分子生成任务中条件属性与实际属性之间的平均偏差最高可降低 33.80%,在 4 个反应预测数据集中 top-1 准确率最高可提升 3.7%。此外,ChemFM 在预测抗生素活性和细胞毒性方面表现出色,凸显了其在发现新抗生素方面的潜力。 Furthermore,我们展示了作为基础模型,ChemFM 在数据效率方面表现突出,仅需极少的标记训练样本即可实现最佳性能。我们预计 ChemFM 将显著推动化学研究的进展,提供一种能够有效泛化于广泛任务且所需额外训练样本极少的基础模型。
引用
@article{arxiv.2410.21422,
title = {ChemFM as a Scaling Law Guided Foundation Model Pre-trained on Informative Chemicals},
author = {Feiyang Cai and Katelin Zacour and Tianyu Zhu and Tzuen-Rong Tzeng and Yongping Duan and Ling Liu and Srikanth Pilla and Gang Li and Feng Luo},
journal= {arXiv preprint arXiv:2410.21422},
year = {2025}
}