基于大语言模型的文本到 SQL、文本到 Python 与文本到函数的重增强——及其在交通领域的实际应用
人工智能
2023-11-01 v2
摘要
先前的最先进(SOTA)方法在 Spider 数据集上取得了卓越的执行准确率,该数据集是文本到 SQL 领域中最大且最具多样性的数据集之一。然而,在我们复现业务数据集时,观察到性能显著下降。我们考察了数据集复杂度的差异以及问题意图的清晰程度,并评估了这些差异如何影响提示方法的性能。随后,我们开发了一种更具适应性和通用性的提示方法,主要包括查询重写和 SQL 增强,前者将模糊信息转化为准确精确的信息,后者通过纳入执行反馈和数据库内容的查询结果来增强 SQL 本身。为防止信息鸿沟,我们将列的注释、值类型和值样本作为数据库描述的一部分纳入提示中。我们使用大语言模型(LLMs)进行的实验显示了在业务数据集上的显著性能提升,并证明了我们方法的巨大潜力。在业务数据集的执行准确率上,SOTA 方法得分为 21.05,而我们的方法得分为 65.79。因此,即便使用能力较弱的预训练语言模型,我们的方法也实现了显著的性能提升。最后,我们还探索了文本到 Python 和文本到函数的选项,并深入分析了它们之间的优缺点,为社区提供了有价值的见解。
引用
@article{arxiv.2310.18752,
title = {Reboost Large Language Model-based Text-to-SQL, Text-to-Python, and Text-to-Function -- with Real Applications in Traffic Domain},
author = {Guanghu Sui and Zhishuai Li and Ziyue Li and Sun Yang and Jingqing Ruan and Hangyu Mao and Rui Zhao},
journal= {arXiv preprint arXiv:2310.18752},
year = {2023}
}