中文

GradeSQL:利用结果奖励模型进行大型语言模型文本到 SQL 生成的测试时推理

人工智能 2025-10-30 v2 计算与语言 数据库

摘要

文本到 SQL,即将自然语言问题翻译成 SQL 查询的任务,随着大型语言模型(LLM)的引入取得了显著进展,拓宽了广大用户访问数据库的途径。尽管在生成有效 SQL 方面取得了实质性进展,当前的 LLM 在处理复杂查询时仍然面临困难。为了解决这一局限性,通常采用测试时策略,如 Best-of-N(BoN)和多数投票(Maj),其假设是 LLM 在多次尝试后能够产生正确答案。然而,这些方法依赖于表面层面的启发式规则,通过基于执行的 BoN(ex-BoN)选择语法正确的查询,或通过多数投票选择最频繁生成的查询。最近,结果奖励模型(ORM)作为一种有前景的强化学习方法出现,它根据语义正确性为生成的输出分配效用分数,以改善模型对齐。我们认为 ORM 可以作为一种有效的新型测试时启发式方法,尽管它们在此背景下的应用在很大程度上仍未得到充分探索。在这项工作中,我们提出了一个统一的框架,用于训练针对 Text-to-SQL 任务定制的 ORM,并评估它们作为 BoN 策略中测试时启发式方法的有效性。我们在 BIRD 和 Spider 数据集上,对来自 Qwen2、Granite3 和 Llama3 系列的不同开源 LLM 进行微调,将 ORM 与 ex-BoN 和 Maj 进行了基准测试。结果表明,ORM 优于 ex-BoN 和 Maj,在执行准确率上,相较于 ex-BoN 分别提升了 +4.33%(BIRD)和 +2.10%(Spider),相较于 Maj 分别提升了 +2.91%(BIRD)和 +0.93%(Spider)。我们进一步证明,对已经与 SQL 生成对齐的模型(如 OmniSQL)进行微调,可以产生更优的 ORM 性能。此外,我们观察到 ORM 在简单查询上取得了有竞争力的结果,并且与 ex-BoN 和 Maj 相比,从候选数量的增加中获益更多。

关键词

引用

@article{arxiv.2509.01308,
  title  = {GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models},
  author = {Mattia Tritto and Giuseppe Farano and Dario Di Palma and Gaetano Rossiello and Fedelucio Narducci and Dharmashankar Subramanian and Tommaso Di Noia},
  journal= {arXiv preprint arXiv:2509.01308},
  year   = {2025}
}