Reward-SQL:通过逐步推理与过程监督奖励提升Text-to-SQL能力
计算与语言
2025-05-20 v2 机器学习
摘要
大型语言模型(LLM)的最新进展通过利用其强大的推理能力,显著提升了在Text-to-SQL任务上的性能。为了在推理过程中提高准确性,可以在训练和推理阶段引入外部过程奖励模型(PRM)以提供细粒度的监督。然而,如果使用不当,PRM可能会扭曲推理轨迹,导致生成次优或错误的SQL。为了应对这一挑战,我们提出了Reward-SQL框架,该框架系统地探索了如何有效地将PRM融入Text-to-SQL推理过程。我们的方法遵循“冷启动,然后PRM监督”的范式。具体来说,我们首先训练模型使用公用表表达式(Chain-of-CTEs)将SQL查询分解为结构化的逐步推理链,从而建立一个强大且可解释的推理基线。然后,我们研究了四种集成PRM的策略,并发现将PRM作为在线训练信号(例如GRPO)与PRM引导的推理(例如best-of-N采样)相结合能产生最佳结果。在BIRD基准测试上,实证结果表明,Reward-SQL使受PRM监督的模型(7B)在各种引导策略下实现了13.1%的性能提升。值得注意的是,我们基于Qwen2.5-Coder-7B-Instruct的GRPO对齐策略模型在BIRD开发集上达到了68.9%的准确率,优于同等模型规模下的所有基线方法。这些结果证明了Reward-SQL在利用基于奖励的监督进行Text-to-SQL推理方面的有效性。
引用
@article{arxiv.2505.04671,
title = {Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards},
author = {Yuxin Zhang and Meihao Fan and Ju Fan and Mingyang Yi and Yuyu Luo and Jian Tan and Guoliang Li},
journal= {arXiv preprint arXiv:2505.04671},
year = {2025}
}