合成SQL列描述及其对文本转SQL性能的影响
计算与语言
2024-11-06 v4 人工智能
数据库
摘要
关系型数据库通常缺乏对表内容的信息丰富描述,例如模糊的列和难以解释的值,这影响了人类用户和文本转SQL模型。在本文中,我们探索使用大语言模型(LLMs)自动为SQL数据库列生成详细的自然语言描述,旨在提高文本转SQL性能并自动化元数据创建。我们基于BIRD-Bench基准测试创建了一个金标准列描述数据集,手动优化了其列描述并创建了列难度分类体系。然后我们评估了多个不同的LLM在数据集的不同列和不同难度下生成列描述的能力,发现模型在具有内在模糊性的列上表现不佳,凸显了人工专家输入的必要性。我们还发现,纳入此类生成的列描述始终能提升文本转SQL模型的性能,尤其是对GPT-4o、Qwen2 72B和Mixtral 22Bx8等大型模型。值得注意的是,Qwen2生成的描述(被标注者认为包含冗余信息)优于人工策划的金标准描述,这表明模型从比人类预期更详细的元数据中受益。未来工作将研究这些高性能描述的具体特征,并探索其他类型的元数据(如数值推理和同义词),以进一步提升文本转SQL系统。数据集、标注和代码都将公开。
引用
@article{arxiv.2408.04691,
title = {Synthetic SQL Column Descriptions and Their Impact on Text-to-SQL Performance},
author = {Niklas Wretblad and Oskar Holmström and Erik Larsson and Axel Wiksäter and Oscar Söderlund and Hjalmar Öhman and Ture Pontén and Martin Forsberg and Martin Sörme and Fredrik Heintz},
journal= {arXiv preprint arXiv:2408.04691},
year = {2024}
}