中文

基于多模态信息的分子联合表示学习

机器学习 2022-11-28 v1 人工智能 生物大分子

摘要

近年来,人工智能在加速药物发现全流程中发挥了重要作用。人们开发了多种不同模态(如文本序列或图)的分子表示方案。通过数字编码,可经相应网络结构学习不同的化学信息。分子图与简化分子线性输入规范(SMILES)是当前分子表示学习中流行的手段。先前工作已尝试将二者结合,以解决单模态表示在各任务中特定信息丢失的问题。为进一步融合此类多模态信息,应考虑从不同表示中学到的化学特征间的对应关系。为此,我们提出一种通过 SMILES 与分子图的多模态信息实现分子联合表示学习的新框架,称为 MMSG。我们通过在 Transformer 中引入键级图表示作为注意力偏置来改进自注意力机制,以增强多模态信息间的特征对应。我们进一步提出双向消息通信图神经网络(BMC GNN)来强化从图聚合的信息流以进一步结合。在公开属性预测数据集上的大量实验证明了我们模型的有效性。

关键词

引用

@article{arxiv.2211.14042,
  title  = {Molecular Joint Representation Learning via Multi-modal Information},
  author = {Tianyu Wu and Yang Tang and Qiyu Sun and Luolin Xiong},
  journal= {arXiv preprint arXiv:2211.14042},
  year   = {2022}
}