中文

基于少量样本学习的上下文感知 SQL 错误纠正 -- 一种基于 NLQ、错误和 SQL 相似性的新方法

计算与语言 2024-10-15 v1

摘要

近年来,自动 SQL 生成的需求显著增加, driven by various applications 中对高效数据查询的需求。然而,由于自然语言输入的复杂性和可变性,生成准确的 SQL 查询仍然是一个挑战。本文引入了一种新颖的基于少量样本学习的方法,用于 SQL 生成中的错误纠正,通过为给定的自然语言问题(NLQ)选择最合适的少量样本错误纠正示例来增强生成查询的准确性。在使用开源 Gretel 数据集进行的实验中,所提出的模型相较于无错误纠正的基线方法实现了 39.2% 的错误修复率提升,相较于简单错误纠正方法实现了 10% 的提升。该技术利用基于嵌入的相似性度量方法,从少量样本示例存储库中识别最接近的匹配项。每个示例包括一个不正确的 SQL 查询、所导致的错误、正确的 SQL 查询以及将不正确查询转换为正确查询的详细步骤。通过采用这种方法,系统能够有效地引导对新生成 SQL 查询中错误的纠正。我们的 approach 在提供与上下文相关的示例以促进错误识别和纠正方面显著提高了 SQL 生成准确性。实验结果突显了基于嵌入的选择在增强少量样本学习过程方面的有效性,导致更精确和可靠的 SQL 查询生成。该研究为自动 SQL 生成领域提供了一套健壮的错误纠正框架,为更先进和用户友好的数据库交互工具铺平了道路。

关键词

引用

@article{arxiv.2410.09174,
  title  = {Context-Aware SQL Error Correction Using Few-Shot Learning -- A Novel Approach Based on NLQ, Error, and SQL Similarity},
  author = {Divyansh Jain and Eric Yang},
  journal= {arXiv preprint arXiv:2410.09174},
  year   = {2024}
}

备注

Accepted for the 1st Workshop on GenAI and RAG Systems for Enterprise @ CIKM 2024