中文

SPARQL 生成:面向生命科学知识图谱问答的 OpenLLaMA 微调分析

人工智能 2025-08-26 v1 计算与语言 数据库 信息检索

摘要

大型语言模型(LLM)在广泛的自然语言处理应用中取得的成功,为利用 LLM 在知识图谱上构建新型问答系统开辟了道路。然而,阻碍其实施的主要障碍之一是缺乏将问题翻译为相应 SPARQL 查询的训练数据,在特定领域知识图谱的情况下尤为如此。为了克服这一挑战,在本研究中,我们评估了在生命科学知识图谱上进行问答时微调 OpenLlama LLM 的几种策略。具体而言,我们提出了一种端到端的数据增强方法,用于将给定知识图谱上的一组现有查询扩展为一个包含语义增强的问题到 SPARQL 查询对的更大数据集,从而使得在这些查询对稀缺的数据集上进行微调成为可能。在此背景下,我们还研究了查询中语义“线索”的作用,例如有意义的变量名和内联注释。最后,我们在真实的 Bgee 基因表达知识图谱上评估了我们的方法,结果表明,与使用随机变量名且不包含注释的基线相比,语义线索可使模型性能提升高达 33%。

关键词

引用

@article{arxiv.2402.04627,
  title  = {SPARQL Generation: an analysis on fine-tuning OpenLLaMA for Question Answering over a Life Science Knowledge Graph},
  author = {Julio C. Rangel and Tarcisio Mendes de Farias and Ana Claudia Sima and Norio Kobayashi},
  journal= {arXiv preprint arXiv:2402.04627},
  year   = {2025}
}

备注

To appear in Proceedings of SWAT4HCLS 2024: Semantic Web Tools and Applications for Healthcare and Life Sciences