中文

将大语言模型对齐到特定领域图数据库以实现NL2GQL

计算与语言 2024-09-06 v3 人工智能 数据库

摘要

图数据库在金融、社交网络和医学等不同领域得到广泛应用。然而,将自然语言(NL)翻译为图查询语言(GQL)(称为NL2GQL)由于其复杂性和专业性而面临重大挑战。一些方法已尝试利用大语言模型(LLM)来处理类似任务,如text2SQL。然而,在针对特定领域的NL2GQL任务中,缺乏领域特定的NL-GQL数据对增加了将LLM与图数据库对齐的复杂性。为应对这一挑战,我们提出了一个定义明确的流水线。首先,我们利用ChatGPT生成NL-GQL数据对,通过自指令利用提供的图数据库。然后,我们使用生成的数据微调LLM,确保LLM与图数据库之间的对齐。此外,我们发现相关模式在高效生成准确GQL中的重要性。因此,我们引入了一种提取相关模式作为输入上下文的方法。我们使用从金融和医学领域图数据库构建的两个精心设计的数据集(名为FinGQL和MediGQL)评估了我们的方法。实验结果表明,我们的方法显著优于一组基线方法,在FinGQL和MediGQL上,EM分别提高了5.90和6.36个绝对百分点,EX分别提高了6.00和7.09个绝对百分点。

关键词

引用

@article{arxiv.2402.16567,
  title  = {Aligning Large Language Models to a Domain-specific Graph Database for NL2GQL},
  author = {Yuanyuan Liang and Keren Tan and Tingyu Xie and Wenbiao Tao and Siyuan Wang and Yunshi Lan and Weining Qian},
  journal= {arXiv preprint arXiv:2402.16567},
  year   = {2024}
}

备注

13 pages,2 figures