中文

CogniSQL-R1-Zero:轻量化强化推理用于高效 SQL 生成

人工智能 2025-07-09 v1

摘要

将自然语言翻译为 SQL(Text-to-SQL)仍是语言理解与结构化数据访问交叉领域的核心挑战。尽管大型语言模型(LLM)已提升流畅度,但生成正确且可执行的 SQL,尤其是针对复杂查询,仍具有挑战性。我们引入 CogniSQL-R1-Zero,一个基于强化学习(RL)的框架和模型,通过基于执行正确性和格式标签合规性的轻量化奖励信号来生成准确的 SQL。通过避免中间监督、混合管道和复杂的奖励塑形,该方法鼓励稳定学习和更强的与最终任务目标一致性——即生成可执行程序。CogniSQL-R1-Zero 在 Text2SQL 数据集和 BIRD 基准上实现了最高的执行准确率,超越了 SFT CodeS-7B、DeepSeek-Coder 236B 和 Mistral 123B 等以前的监督和指令微调基线,尽管其训练 backbone 规模仅为 7B。这一结果凸显了基于 RL 的方法在仅使用四个 NVIDIA A100 GPU(每块 40 GB VRAM)的情况下具有的可扩展性和效率。为支持高效且可解释的 Text-to-SQL 模型进一步研究,我们发布了两个精选数据集:(i)一组包含 5,024 条推理痕迹且上下文长度各异的数据集,(ii)一组 36,356 条弱监督查询的正样本语料库,每条查询均标注有六条语义多样化的推理路径。这些贡献共同推动了可扩展且与执行对齐的 Text-to-SQL 生成。

关键词

引用

@article{arxiv.2507.06013,
  title  = {CogniSQL-R1-Zero: Lightweight Reinforced Reasoning for Efficient SQL Generation},
  author = {Kushal Gajjar and Harshit Sikchi and Arpit Singh Gautam and Marc Hammons and Saurabh Jha},
  journal= {arXiv preprint arXiv:2507.06013},
  year   = {2025}
}