OpenTable-R1:用于开域表格问答的强化学习增强工具代理
计算与语言
2025-07-08 v1
摘要
开域表格问答传统上依赖于两阶段流程:静态表格检索 followed by 封闭域答案。相反,我们提出一种 end-to-end 代理框架,将多轮工具调用——使用 BM25+-based 搜索 API 和 SQLite SQL 执行器——直接嵌入大型语言模型。为进一步适配紧凑的 4B 参数模型,我们引入两种微调过程:对易问题进行监督式 cold-start,然后使用 LoRA adapter 和 rollout buffer 对更难案例进行 Async GRPO 强化学习。这种统一方法使模型能够联合检索、推理和执行查询,使准确率从零样本性能的个位数显著提升至测试集上超过 0.86 的 exact match。我们的结果凸显了将结构化工具调用与针对性 RL 微调相结合对于可扩展、准确表格问答的有效性。代码可在 https://github.com/TabibitoQZP/OpenTableR1 获取。
引用
@article{arxiv.2507.03018,
title = {OpenTable-R1: A Reinforcement Learning Augmented Tool Agent for Open-Domain Table Question Answering},
author = {Zipeng Qiu},
journal= {arXiv preprint arXiv:2507.03018},
year = {2025}
}