面向大规模多任务数据集的分子学习基础模型探索
机器学习
2023-10-19 v3
摘要
近年来,预训练基础模型在多个领域取得了显著进展。然而,在分子机器学习中,数据集通常经过人工筛选,因而往往规模较小,且缺乏带有标注特征的数据集以及管理这些数据集的代码库,这阻碍了基础模型的发展。在本工作中,我们提出了七个新颖的数据集,按规模分为三类:ToyMix、LargeMix 和 UltraLarge。这些数据集在分子学习的监督标签规模和多样性方面均突破了现有边界。它们涵盖近 1 亿个分子以及超过 3000 个稀疏定义的任务,总计超过 130 亿个量子与生物性质的独立标签。相比之下,我们的数据集包含的数据点是广泛使用的 OGB-LSC PCQM4Mv2 数据集的 300 倍,是仅含量子数据的 QM1B 数据集的 13 倍。此外,为支持基于我们所提出数据集的基础模型开发,我们推出了 Graphium 图机器学习库,该库简化了针对多任务和多层级分子数据集构建与训练分子机器学习模型的过程。最后,我们给出了一系列基线结果,作为在这些数据集上进行多任务和多层级训练的出发点。经验上,我们观察到在低资源生物数据集上的性能也通过训练大量量子数据而得到提升。这表明在多任务和多层级基础模型训练并将其微调至资源受限的下游任务方面存在潜在可能。
引用
@article{arxiv.2310.04292,
title = {Towards Foundational Models for Molecular Learning on Large-Scale Multi-Task Datasets},
author = {Dominique Beaini and Shenyang Huang and Joao Alex Cunha and Zhiyi Li and Gabriela Moisescu-Pareja and Oleksandr Dymov and Samuel Maddrell-Mander and Callum McLean and Frederik Wenkel and Luis Müller and Jama Hussein Mohamud and Ali Parviz and Michael Craig and Michał Koziarski and Jiarui Lu and Zhaocheng Zhu and Cristian Gabellini and Kerstin Klaser and Josef Dean and Cas Wognum and Maciej Sypetkowski and Guillaume Rabusseau and Reihaneh Rabbany and Jian Tang and Christopher Morris and Ioannis Koutis and Mirco Ravanelli and Guy Wolf and Prudencio Tossou and Hadrien Mary and Therence Bois and Andrew Fitzgibbon and Błażej Banaszewski and Chad Martin and Dominic Masters},
journal= {arXiv preprint arXiv:2310.04292},
year = {2023}
}