面向大规模异质知识图谱的可扩展可解释基于规则的链接预测
机器学习
2020-12-11 v1 人工智能
信息检索
摘要
基于神经嵌入的机器学习模型在预测生物医学知识图谱中的新颖链接方面已展现出潜力。遗憾的是,其缺乏可解释性削弱了实际效用。近来,完全可解释的基于规则的算法AnyBURL在许多通用链接预测基准上取得了极具竞争力的结果。然而,其在复杂生物医学知识库上的大规模预测任务中的适用性受限于较长的推理时间以及难以聚合多条规则的预测。我们通过引入SAFRAN规则应用框架改进AnyBURL,该框架通过可扩展聚类算法聚合规则。SAFRAN在已建立的通用基准FB15K-237和大规模生物医学基准OpenBioLink上取得了完全可解释链接预测的新SOTA结果。此外,它在FB15K-237上超越了多个成熟的基于嵌入的算法,并在OpenBioLink上缩小了基于规则与基于嵌入的算法之间的差距。我们还表明SAFRAN将推理速度提升了最高两个数量级。
引用
@article{arxiv.2012.05750,
title = {Scalable and interpretable rule-based link prediction for large heterogeneous knowledge graphs},
author = {Simon Ott and Laura Graf and Asan Agibetov and Christian Meilicke and Matthias Samwald},
journal= {arXiv preprint arXiv:2012.05750},
year = {2020}
}