ExCoT:基于执行反馈优化文本到 SQL 的推理
机器学习
2025-03-27 v1 人工智能
数据库
摘要
文本到 SQL 需要精确推理将自然语言问题转换为结构化查询。虽然大型语言模型 (LLM) 在许多推理任务中表现出色,但其在文本到 SQL 场景中利用链式思维 (CoT) 推理的潜力尚未充分探索。我们识别出关键局限性:零-shot CoT 仅提供最小提升,直接偏好优化 (DPO) 应用而不含 CoT 仅带来边际改进。我们提出 ExCoT,一种新型框架,通过结合 CoT 推理与 off-policy 和 on-policy DPO 实现开源 LLM 的迭代优化,仅依赖执行准确率作为反馈。该方法无需奖励模型或人工标注的偏好。实验结果表明,ExCoT 在 BIRD dev 集合上将执行准确率从 57.37% 提升至 68.51%,在 Spider test 集合上从 78.81% 提升至 86.59%(LLaMA-3 70B),Qwen-2.5-Coder 也取得类似提升。我们的最佳模型在 BIRD 和 Spider 数据集的单模型设置下实现最先进性能,尤其在 BIRD test 集合上达到 68.53%。
引用
@article{arxiv.2503.19988,
title = {ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback},
author = {Bohan Zhai and Canwen Xu and Yuxiong He and Zhewei Yao},
journal= {arXiv preprint arXiv:2503.19988},
year = {2025}
}