MolCPT:泛化分子表示学习的分子连续提示微调
机器学习
2023-09-26 v2 定量方法
摘要
分子表示学习对于分子性质预测问题至关重要,其中图神经网络 (GNN) 由于其结构建模能力而成为一种有效的解决方案。由于标注数据通常稀缺且获取昂贵,GNN 在广阔的分子空间中泛化是一个巨大挑战。最近,“预训练-微调”的训练范式被用于提高 GNN 的泛化能力。它使用自监督信息对 GNN 进行预训练,然后仅用少量标签进行微调以优化下游任务。然而,预训练并不总是能带来统计学上的显著提升,特别是对于带有随机结构掩码的自监督学习。事实上,分子结构的特征在于基序子图,它们频繁出现并影响分子性质。为了利用与任务相关的基序,我们提出了一种用于分子表示学习的新颖的“预训练-提示-微调”范式,称为分子连续提示微调 (MolCPT)。MolCPT 定义了一个基序提示函数,该函数使用预训练模型将独立输入投影为富有表现力的提示。该提示在连续表示空间中用有意义的基序有效地增强了分子图;这为下游分类器识别分子性质提供了更多的结构模式。在几个基准数据集上的大量实验表明,MolCPT 能够高效地泛化预训练的 GNN 以进行分子性质预测,无论是否经过少量微调步骤。
引用
@article{arxiv.2212.10614,
title = {MolCPT: Molecule Continuous Prompt Tuning to Generalize Molecular Representation Learning},
author = {Cameron Diao and Kaixiong Zhou and Zirui Liu and Xiao Huang and Xia Hu},
journal= {arXiv preprint arXiv:2212.10614},
year = {2023}
}