中文

Otter-Knowledge:面向药物发现的来自多源多模态知识图谱表示学习基准

机器学习 2023-10-23 v3 人工智能 生物大分子

摘要

近期关于预测药物分子与蛋白质之间结合亲和力的研究,利用通过无监督学习技术从大规模分子 SMILES 与蛋白质序列数据库中学习到的表示。尽管这些表示显著提升了预测效果,但它们通常基于有限模态集合,且未利用分子与蛋白质间已有关系的知识。在本研究中,我们证明通过将来自不同来源与模态的知识图谱整合进序列或 SMILES 表示中,可进一步丰富表示,并在成熟的 Therapeutic Data Commons (TDC) 基准上取得药物-靶点结合亲和力预测的当前最优结果。我们发布了一组多模态知识图谱,整合了七个公共数据源的数据,包含超过 3000 万条三元组。我们的意图是促进更多研究来探索多模态知识增强的蛋白质/分子嵌入如何改善预测任务,包括结合亲和力预测。我们还发布了从我们的多模态知识图谱中学习到的一些预训练模型,以及用于运行结合亲和力预测标准基准任务的源代码。

关键词

引用

@article{arxiv.2306.12802,
  title  = {Otter-Knowledge: benchmarks of multimodal knowledge graph representation learning from different sources for drug discovery},
  author = {Hoang Thanh Lam and Marco Luca Sbodio and Marcos Martínez Galindo and Mykhaylo Zayats and Raúl Fernández-Díaz and Víctor Valls and Gabriele Picco and Cesar Berrospi Ramis and Vanessa López},
  journal= {arXiv preprint arXiv:2306.12802},
  year   = {2023}
}