中文

$\texttt{MiniMol}$:一种参数高效的分子学习基础模型

机器学习 2024-04-24 v1 人工智能

摘要

在生物任务中,数据很少是充足的,因为它们来自难以收集的测量。因此,在大量可用数据上预训练基础模型,然后迁移到低数据下游任务是一个有前景的方向。然而,如何设计有效的分子学习基础模型仍然是一个开放问题,现有方法通常关注具有大参数容量的模型。本文提出MiniMol\texttt{MiniMol},一个具有1000万参数的分子学习基础模型。MiniMol\texttt{MiniMol}在约3300个稀疏定义的图级和节点级任务(兼具量子与生物性质)的混合数据上进行预训练。预训练数据集包含约600万个分子和5亿个标签。为了展示MiniMol\texttt{MiniMol}跨任务的泛化能力,我们在治疗数据共享(TDC)ADMET组的下游任务上进行了评估,在17个任务上相比先前最先进的基础模型取得了显著改进。MiniMol\texttt{MiniMol}将作为公开开源模型供未来研究使用。

关键词

引用

@article{arxiv.2404.14986,
  title  = {$\texttt{MiniMol}$: A Parameter-Efficient Foundation Model for Molecular Learning},
  author = {Kerstin Kläser and Błażej Banaszewski and Samuel Maddrell-Mander and Callum McLean and Luis Müller and Ali Parviz and Shenyang Huang and Andrew Fitzgibbon},
  journal= {arXiv preprint arXiv:2404.14986},
  year   = {2024}
}