分子图上的自监督学习:遮蔽设计的系统性调查
机器学习
2025-12-09 v1 人工智能
定量方法
摘要
自监督学习 (SSL) 在分子表示学习中占据核心地位。然而,近期许多基于遮蔽的预训练创新以经验性方法引入,缺乏原则性评估,掩盖了哪些设计选择真正有效。本 work 将整个 pretrain-finetune 工作流程置于统一的概率框架中,实现透明的比较和更深入的理解。建立在该正式化基础上,我们在严格受控的设置下,对三个核心设计维度进行受控研究:遮蔽分布、预测目标和 encoder architecture。我们进一步采用信息论措施评估 pretraining 信号的 informative 程度,并将其与 empirically benchmarked downstream performance 联系起来。我们的发现揭示了一个令人惊讶的洞见:针对 common node-level prediction 任务的复杂遮蔽分布相对于均匀采样没有一致的优势。相反,预测目标的选择以及其与 encoder architecture 的协同作用远比重要。具体而言,转向语义更丰富的目标可显著提升 downstream performance,尤其是当与 expression Graph Transformer encoders 配合时。这些见解为开发更有效的分子图 SSL 方法提供了实用指导。
引用
@article{arxiv.2512.07064,
title = {Self-Supervised Learning on Molecular Graphs: A Systematic Investigation of Masking Design},
author = {Jiannan Yang and Veronika Thost and Tengfei Ma},
journal= {arXiv preprint arXiv:2512.07064},
year = {2025}
}