中文

SQL-ASTRA:通过列集匹配与轨迹聚合缓解代理 SQL 中的稀疏反馈

人工智能 2026-03-18 v1

摘要

代理强化学习 (RL) 在复杂任务中显示出前景,但文本到 SQL 仍主要局限于单轮范式。主要瓶颈在于信用分配问题。在传统范式中,奖励仅由最终轮的反馈决定,这忽略了中间过程,导致信用评估模糊。为此,我们提出 Agentic SQL 框架, featuring 一个通用的两层奖励机制,用于提供有效的轨迹级评估和稠密的步骤级信号。首先,我们引入聚合轨迹奖励 (ATR),以解决多轮信用分配。利用非对称转移矩阵,ATR 聚合过程导向的评分,以激励持续改进。基于 Lyapunov 稳定性理论,我们证明 ATR 充当能量耗散算子,保证政策无环且单调收敛。其次,列集匹配奖励 (CSMR) 提供即时步骤级奖励以缓解稀疏性。通过在每个步骤执行查询,CSMR 将二元 (0/1) 反馈转换为基于部分正确性的稠密 [0, 1] 信号。在 BIRD 上评估显示,相较于二元奖励的 GRPO,本方法取得 5% 的提升。值得注意的是,在相同模型下,我们的方法在 BIRD 和 Spider 2.0 上均超过了 SOTA Arctic-Text2SQL-R1-7B,推动文本到 SQL 向稳健的多轮代理范式迈进。

关键词

引用

@article{arxiv.2603.16161,
  title  = {SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation},
  author = {Long Li and Zhijian Zhou and Jiangxuan Long and Peiyang Liu and Weidi Xu and Zhe Wang and Shirui Pan and Chao Qu},
  journal= {arXiv preprint arXiv:2603.16161},
  year   = {2026}
}

备注

17 pages