从化学反应知识中学习上下文分子表示
机器学习
2024-02-22 v1 人工智能
生物大分子
摘要
近年来,自监督学习作为一种利用海量无标签数据进行表示学习的强大工具而兴起,并已被广泛应用于各个领域。然而,当应用于分子表示学习(MRL)时,诸如掩码子单元重建等主流技术往往表现不佳,原因在于分子内原子可能组合的自由度很高,这给掩码-重建范式带来了难以克服的复杂性。为了应对这一挑战,我们引入了 REMO,这是一种利用常见化学中明确定义的原子组合规则的自监督学习框架。具体而言,REMO 在文献中的 170 万个已知化学反应上对图/Transformer 编码器进行了预训练。我们提出了两个预训练目标:掩码反应中心重建(MRCR)和反应中心识别(RCI)。REMO 通过利用化学反应中潜在的共享模式作为预训练的 \textit{context}(上下文),为 MRL 提供了一种新颖的解决方案,能够有效推断出常见化学知识的有意义的表示。这些上下文表示随后可用于支持各种下游分子任务,且仅需最少的微调,例如亲和力预测和药物-药物相互作用预测。在 MoleculeACE、ACNet、药物-药物相互作用(DDI)和反应类型分类上的大量实验结果表明,在所有测试的下游任务中,REMO 均优于当前 MRL 中使用的单分子掩码建模标准基线。值得注意的是,REMO 是在活性悬崖基准上超越基于指纹方法的开创性深度学习模型。
引用
@article{arxiv.2402.13779,
title = {Contextual Molecule Representation Learning from Chemical Reaction Knowledge},
author = {Han Tang and Shikun Feng and Bicheng Lin and Yuyan Ni and JIngjing Liu and Wei-Ying Ma and Yanyan Lan},
journal= {arXiv preprint arXiv:2402.13779},
year = {2024}
}
备注
Preprint. Under Review