阿拉伯语文本到SQL的上下文相关提示工程技术
计算与语言
2025-11-27 v1 数据库
摘要
近年来,跨域、上下文相关的文本到SQL任务受到广泛关注。该任务使使用自然语言与数据库进行对话的用户(无需SQL知识)能够实现。然而,大多数现有数据集和研究都在英文中进行,以及一些中文工作。迄今为止,尚未尝试在阿拉伯语中解决此任务。本文引入了Ar-SParC,即首个阿拉伯语跨域、上下文相关文本到SQL数据集。该数据集包含3,450个序列的相互关联问题,其中每个序列包含约三个问题的平均数量,总计10,225个问题及其对应的SQL查询。我们在Ar-SParC数据集上进行了40次实验,使用两个大型语言模型GPT-3.5-turbo和GPT-4.5-turbo,应用10种不同的提示工程技术,包括四种问题表示方法和六种基于情境学习技术。此外,我们开发了一种名为GAT corrector的新方法,该方法在所有40次实验中均提升了性能,在零shot设置下,执行准确率(EX)和交互准确率(IX)平均提高1.9%,在基于情境学习设置下,EX和IX分别平均提高1.72%和0.92%。最后,我们进行了两项消融研究,以解释为何GAT corrector在阿拉伯语中优于以往的GAT verifier技术。
引用
@article{arxiv.2511.20677,
title = {Prompt Engineering Techniques for Context-dependent Text-to-SQL in Arabic},
author = {Saleh Almohaimeed and May Alsofyani and Saad Almohaimeed and Mansour Al Ghanim and Liqiang Wang},
journal= {arXiv preprint arXiv:2511.20677},
year = {2025}
}
备注
Accepted at IJCNN 2025 (to appear in IEEE/IJCNN proceedings). This arXiv submission corresponds to the camera-ready version