$\texttt{MiniMol}$:一种参数高效的分子学习基础模型
机器学习
2024-04-24 v1 人工智能
摘要
在生物任务中,数据很少是充足的,因为它们来自难以收集的测量。因此,在大量可用数据上预训练基础模型,然后迁移到低数据下游任务是一个有前景的方向。然而,如何设计有效的分子学习基础模型仍然是一个开放问题,现有方法通常关注具有大参数容量的模型。本文提出,一个具有1000万参数的分子学习基础模型。在约3300个稀疏定义的图级和节点级任务(兼具量子与生物性质)的混合数据上进行预训练。预训练数据集包含约600万个分子和5亿个标签。为了展示跨任务的泛化能力,我们在治疗数据共享(TDC)ADMET组的下游任务上进行了评估,在17个任务上相比先前最先进的基础模型取得了显著改进。将作为公开开源模型供未来研究使用。
引用
@article{arxiv.2404.14986,
title = {$\texttt{MiniMol}$: A Parameter-Efficient Foundation Model for Molecular Learning},
author = {Kerstin Kläser and Błażej Banaszewski and Samuel Maddrell-Mander and Callum McLean and Luis Müller and Ali Parviz and Shenyang Huang and Andrew Fitzgibbon},
journal= {arXiv preprint arXiv:2404.14986},
year = {2024}
}