中文

TaTToo:面向表格推理的工具驱动思考PRM用于测试时扩展

人工智能 2025-10-08 v1 计算与语言 机器学习

摘要

过程奖励模型(PRMs)最近作为增强大型推理模型(LRMs)推理能力的强大框架,尤其在测试时扩展(TTS)上下文中发挥作用。然而,针对表格推理领域的潜力仍未得到充分探索。通过详细的经验分析,我们发现现有的PRMs虽然广泛用于监督文本推理步骤,但在表格特定操作(如子表检索和模式交互)方面存在挑战,导致关键性的性能瓶颈。为此,我们提出TaTToo,一个新颖的表格 grounding PRM框架,该框架(1)显式地对表格推理步骤进行推理,(2)集成基于工具的验证以提供精确的奖励监督。具体而言,我们首先设计了一个可扩展的数据 curated pipeline,通过将表格验证理由与基于工具的执行集成,构建超过6万个高质量的步骤级标注。基于收集的数据,我们采用双阶段范式进行训练:cold-start监督微调以捕获工具使用推理模式,随后采用基于工具的奖励引导进行强化学习,以将模型与基于表格的验证对齐。我们提供了对新设计的PRM所诱导的策略改进进行全面评估。在覆盖数值推理、事实核查和数据分析等5个具有挑战性的表格推理基准测试上,TaTToo在推理时提升了下游策略 LRMs 30.9%,超越了Qwen-2.5-Math-PRM-72B等强大的PRM基线,只需80亿参数即可实现,且在多样化的TTS策略上表现出强大的通用性。

关键词

引用

@article{arxiv.2510.06217,
  title  = {TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning},
  author = {Jiaru Zou and Soumya Roy and Vinay Kumar Verma and Ziyi Wang and David Wipf and Pan Lu and Sumit Negi and James Zou and Jingrui He},
  journal= {arXiv preprint arXiv:2510.06217},
  year   = {2025}
}