Agentar-Scale-SQL:通过编排式测试时扩展推进文本到SQL
计算与语言
2025-12-11 v6 数据库
摘要
最先进的文本到SQL方法在BIRD等具有挑战性的基准测试上仍显著落后于人类专家。当前探索测试时扩展的方法缺乏编排策略,且忽视了模型的内部推理过程。为了弥补这一差距,我们引入了Agentar-Scale-SQL,一个利用可扩展计算来提升性能的新型框架。Agentar-Scale-SQL实现了一种编排式测试时扩展策略,协同结合三个不同视角:i) 通过强化学习增强内在推理的内部扩展,ii) 通过迭代优化实现的顺序扩展,iii) 利用多样化合成与锦标赛选择的并行扩展。Agentar-Scale-SQL是一个通用框架,易于适配新数据库和更强大的语言模型。大量实验表明,Agentar-Scale-SQL在BIRD基准测试上取得了最先进的性能,在测试集上达到81.67%的执行准确率,并在官方排行榜上排名第一,展示了通向人类水平表现的有效路径。
引用
@article{arxiv.2509.24403,
title = {Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling},
author = {Pengfei Wang and Baolin Sun and Xuemei Dong and Yaxun Dai and Hongwei Yuan and Mengdie Chu and Yingqi Gao and Xiang Qi and Peng Zhang and Ying Yan},
journal= {arXiv preprint arXiv:2509.24403},
year = {2025}
}