中文

Agentar-Scale-SQL:通过编排式测试时扩展推进文本到SQL

计算与语言 2025-12-11 v6 数据库

摘要

最先进的文本到SQL方法在BIRD等具有挑战性的基准测试上仍显著落后于人类专家。当前探索测试时扩展的方法缺乏编排策略,且忽视了模型的内部推理过程。为了弥补这一差距,我们引入了Agentar-Scale-SQL,一个利用可扩展计算来提升性能的新型框架。Agentar-Scale-SQL实现了一种编排式测试时扩展策略,协同结合三个不同视角:i) 通过强化学习增强内在推理的内部扩展,ii) 通过迭代优化实现的顺序扩展,iii) 利用多样化合成与锦标赛选择的并行扩展。Agentar-Scale-SQL是一个通用框架,易于适配新数据库和更强大的语言模型。大量实验表明,Agentar-Scale-SQL在BIRD基准测试上取得了最先进的性能,在测试集上达到81.67%的执行准确率,并在官方排行榜上排名第一,展示了通向人类水平表现的有效路径。

关键词

引用

@article{arxiv.2509.24403,
  title  = {Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling},
  author = {Pengfei Wang and Baolin Sun and Xuemei Dong and Yaxun Dai and Hongwei Yuan and Mengdie Chu and Yingqi Gao and Xiang Qi and Peng Zhang and Ying Yan},
  journal= {arXiv preprint arXiv:2509.24403},
  year   = {2025}
}