中文

揭示链式思考推理在直接偏好优化中的影响:基于Text-to-SQL的经验

计算与语言 2025-02-18 v1 数据库

摘要

直接偏好优化(DPO)在数学题解和代码生成等复杂推理任务中已证明有效。然而,应用于Text-to-SQL数据集时,常常无法提升性能,甚至会导致性能下降。我们的调查揭示了根本原因:与数学和代码任务不同,后者自然地将链式思考(CoT)推理与DPO集成,而Text-to-SQL数据集通常仅包含最终答案(金标准SQL查询),而不包含详细的CoT解答。通过为Text-to-SQL数据集增添合成CoT解答,我们首次实现了使用DPO的持续显著性能提升。我们的分析表明,CoT推理对于释放DPO潜力至关重要,因为它缓解了奖励欺骗,强化了判别能力,并提升了可扩展性。这些发现为构建更稳健的Text-to-SQL模型提供了宝贵见解。为支持进一步的研究,我们公开代码和CoT增强后的数据集。

关键词

引用

@article{arxiv.2502.11656,
  title  = {Uncovering the Impact of Chain-of-Thought Reasoning for Direct Preference Optimization: Lessons from Text-to-SQL},
  author = {Hanbing Liu and Haoyang Li and Xiaokang Zhang and Ruotong Chen and Haiyong Xu and Tian Tian and Qi Qi and Jing Zhang},
  journal= {arXiv preprint arXiv:2502.11656},
  year   = {2025}
}