中文

理解知识图谱嵌入在药物发现中的性能表现

生物大分子 2022-06-01 v4 人工智能 机器学习

摘要

知识图谱(KG)及相关的知识图谱嵌入(KGE)模型近来开始在药物发现背景下被探索,并有望辅助靶点识别等关键挑战。在药物发现领域,KG可作为流程的一部分,导致基于实验室的实验被执行,或影响其他决策,从而产生显著的时间与财务成本,最重要的是最终影响患者医疗。要使KGE模型在该领域产生影响,不仅需要更好地理解其性能,还需理解决定性能的各种因素。在本研究中,我们通过数千次实验,考察了五种KGE模型在两个面向药物发现的公开KG上的预测性能。我们的目标并非聚焦于最佳整体模型或配置,而是深入探究训练设置的变化、超参数的选择、模型参数初始化种子以及数据集的不同划分如何影响其性能。我们的结果强调,这些因素对性能有显著影响,甚至可能影响模型的排名。事实上,这些因素应与模型架构一并报告,以确保未来工作的完全可复现性与公平比较,我们认为这对于生物医学环境中KGE的接受与使用及其影响至关重要。

关键词

引用

@article{arxiv.2105.10488,
  title  = {Understanding the Performance of Knowledge Graph Embeddings in Drug Discovery},
  author = {Stephen Bonner and Ian P Barrett and Cheng Ye and Rowan Swiers and Ola Engkvist and Charles Tapley Hoyt and William L Hamilton},
  journal= {arXiv preprint arXiv:2105.10488},
  year   = {2022}
}