中文

Table-R1:基于区域的强化学习用于表格理解

计算与语言 2026-05-14 v3 人工智能

摘要

表格因其结构化的行列交互,为语言模型带来了独特挑战, necessitating 专门的方法才能有效理解。虽然大型语言模型(LLM)通过提示和链式思考(CoT)和程序思考(PoT)等技术在表格推理方面显示出潜力,但优化其在表格问答任务中的性能仍属未充分探索的领域。本文引入 region-based Table-R1,一种新颖的强化学习方法,通过整合区域证据来增强 LLM 表格理解能力。我们采用 Region-Enhanced Supervised Fine-Tuning(RE-SFT)指导模型识别相关表格区域后再生成答案,融合文本、符号和程序化推理。此外,Table-Aware Group Relative Policy Optimization(TARPO)引入混合奖励系统,以动态平衡区域准确性和答案正确性,采用递减区域奖励和一致性惩罚以协调推理步骤。实验表明,Table-R1 在三个基准数据集上以多个基础模型实现平均提升 14.36 分,即使超过参数量是其十倍的基线模型,同时 TARPO 比 GRPO 减少 67.5% 的响应 token 消耗,显著推进了 LLM 在高效表格推理方面的能力。

关键词

引用

@article{arxiv.2505.12415,
  title  = {Table-R1: Region-based Reinforcement Learning for Table Understanding},
  author = {Zhenhe Wu and Jian Yang and Zhongjiang He and Changzai Pan and Jie Zhang and Jiaheng Liu and Xianjie Wu and Yu Zhao and Shuangyong Song and Yongxiang Li and Zhoujun Li and Xueling Li},
  journal= {arXiv preprint arXiv:2505.12415},
  year   = {2026}
}