中文

搭建语义鸿沟:基于 GRPO 的多语言文本到 SQL 对比奖励

计算与语言 2025-11-24 v2 人工智能

摘要

当前文本到 SQL 方法仅关注可执行查询,忽略语义对齐挑战——无论是查询语义意义还是执行结果的正确性。即使执行准确率本身在从英文转向其他语言时也出现显著下降,跨非英文语言平均下降 6 个百分点。我们通过在多语言对比奖励信号中结合组相对策略优化 (GRPO) 的新框架来解决这些挑战,以增强文本到 SQL 系统在跨语言场景中的任务效率和语义准确性。我们的方法通过结合基于语义相似性的奖励信号,教会模型获得更好的 SQL 生成与用户意图之间的对应关系。在七语言 MultiSpider 数据集上,使用 GRPO 微调 LLaMA-3-3B 模型后,执行准确率提升至 87.4 percent(零样本提升 26 pp),语义准确率提升至 52.29 percent(提升 32.86 pp)。在 GRPO 框架中加入我们对比奖励信号后,平均语义准确率提升至 59.14 percent(提升 6.85 pp,对越南语最高提升 10 pp)。我们的实验表明,使用我们对比奖励信号在 3B 参数的小型 LLaMA 模型上微调,即可超越大型零样本 8B LLaMA 模型,在执行准确率提升 7.43 pp(从 8B 模型的 81.43 percent 提升至 3B 模型的 88.86 percent),语义准确率几乎匹配(59.14 percent vs. 68.57 percent)——全部仅使用 3000 个强化学习训练示例。这些结果表明,我们可以在不要求大规模训练数据集的情况下,通过针对有导向语义对齐的对比奖励来提高文本到 SQL 系统的性能。

关键词

引用

@article{arxiv.2510.13827,
  title  = {Bridging the Semantic Gap: Contrastive Rewards for Multilingual Text-to-SQL with GRPO},
  author = {Ashish Kattamuri and Ishita Prasad and Meetu Malhotra and Arpita Vats and Rahul Raja and Albert Lie},
  journal= {arXiv preprint arXiv:2510.13827},
  year   = {2025}
}

备注

20th International Workshop on Semantic and Social Media Adaptation & Personalization