中文

UniMAP:通用 SMILES-图表示学习

机器学习 2024-11-05 v2 人工智能 生物大分子

摘要

分子表示学习是诸多药物相关应用的基础。现有分子预训练模型多局限于单一分子模态,即 SMILES 或图表示。为有效利用两种模态,我们认为捕获 SMILES 与图之间细粒度的“语义”至关重要,因为细微的序列/图差异可能导致相反的分子性质。本文提出一种通用 SMILES-图表示学习模型,即 UniMAP。首先,采用嵌入层分别获取 SMILES 与图中的词元及节点/边表示;随后利用多层 Transformer 进行深度跨模态融合。特别地,为 UniMAP 设计了四类预训练任务,包括多级跨模态掩码(CMM)、SMILES-图匹配(SGM)、片段级对齐(FLA)与领域知识学习(DKL)。由此,全局(即 SGM 与 DKL)与局部(即 CMM 与 FLA)对齐被集成以实现全面跨模态融合。我们在多种下游任务上评估 UniMAP,即分子性质预测、药物-靶点亲和力预测与药物-药物相互作用。实验结果显示 UniMAP 优于当前 SOTA 预训练方法。我们亦对所学表示进行可视化以展示多模态融合的效果。

关键词

引用

@article{arxiv.2310.14216,
  title  = {UniMAP: Universal SMILES-Graph Representation Learning},
  author = {Shikun Feng and Lixin Yang and Yanwen Huang and Yuyan Ni and Weiying Ma and Yanyan Lan},
  journal= {arXiv preprint arXiv:2310.14216},
  year   = {2024}
}