大型生物信息学问答对集合:聚合知识图谱上的方法与应用
数据库
2025-08-26 v1 人工智能
信息检索
摘要
背景。过去数十年间,多个生命科学资源均采用相同的框架对数据进行结构化处理,并使用相同的查询语言使其可被访问,以促进互操作性。由于其在以通用图格式表示数据方面的优势,知识图谱在生物信息学领域获得了越来越多的采纳。例如,yummydata.org 目录化了超过60个通过SPARQL查询的知识图谱。虽然SPARQL允许跨物理分布的知识图谱执行强大且富有表现力的查询,但对于大多数用户而言,构筑此类查询仍然具有挑战性。因此,为引导用户检索相关数据,这些资源许多提供示例性查询。这些示例也可作为机器学习的重要信息来源,如果在不同资源之间以足够大的数量提供,并以一种常见的、机器可读且标准化的格式发布。发现。我们介绍了一个大型人类撰写的自然语言问题及其对应的SPARQL查询的集合,这些查询在SIB瑞士生物信息学研究所多个研究小组多年收集的聚合生物信息学知识图谱上。该集合包含超过1000个示例问题和查询,其中包括65个聚合查询。我们提出了一种基于现有标准的统一表示示例的方法,仅使用最小的元数据。此外,我们引入了一套广泛的开源应用程序,包括查询图可视化和智能查询编辑器,易于由采用所提方法的知识图谱维护者重用。结论。我们鼓励社区采纳并扩展所提方法,以实现更丰富的知识图谱元数据和改进的语义网服务。
引用
@article{arxiv.2410.06010,
title = {A large collection of bioinformatics question-query pairs over federated knowledge graphs: methodology and applications},
author = {Jerven Bolleman and Vincent Emonet and Adrian Altenhoff and Amos Bairoch and Marie-Claude Blatter and Alan Bridge and Severine Duvaud and Elisabeth Gasteiger and Dmitry Kuznetsov and Sebastien Moretti and Pierre-Andre Michel and Anne Morgat and Marco Pagni and Nicole Redaschi and Monique Zahn-Zabal and Tarcisio Mendes de Farias and Ana Claudia Sima},
journal= {arXiv preprint arXiv:2410.06010},
year = {2025}
}