中文

GRPO 是否能提升复杂多模态表格理解?

计算与语言 2026-03-27 v3

摘要

现有的表格理解方法因表格结构的复杂性和复杂的逻辑推理而面临挑战。虽然监督微调 (SFT) 主导现有研究,但强化学习 (RL),如基于组相对策略优化 (GRPO),在此方面显示出前景,但在表格情境中因初始策略准确率低和奖励粗糙而难以实现。本文引入 Table-R1,一个三阶段 RL 框架,通过:(1) 热身阶段促进初始感知和推理能力,(2) 采用连续树编辑距离相似度 (TEDS) 奖励的感知对齐 GRPO (PA-GRPO) 实现表格结构和内容识别,(3) 基于提示引导的问题的残差步骤的细粒度奖励的提示完成 GRPO (HC-GRPO),来增强多模态表格理解。广泛的实验表明,Table-R1 在保持内和 held-out 数据集上均能显著提升模型的表格推理性能,超越 SFT 和 GRPO。值得注意的是,搭载 Table-R1 的 Qwen2-VL-7B 甚至能超越特定表格理解模型(如 Table-LLaVA 13B),并在 held-in 数据集上实现与闭源模型 GPT-4o 相当的性能,展示了 Table-R1 每个阶段在克服初始化瓶颈和奖励稀疏性方面的有效性,从而推动了稳健的多模态表格理解。

关键词

引用

@article{arxiv.2509.16889,
  title  = {Can GRPO Boost Complex Multimodal Table Understanding?},
  author = {Xiaoqiang Kang and Shengen Wu and Zimu Wang and Yilin Liu and Xiaobo Jin and Kaizhu Huang and Wei Wang and Yutao Yue and Xiaowei Huang and Qiufeng Wang},
  journal= {arXiv preprint arXiv:2509.16889},
  year   = {2026}
}

备注

EMNLP 2025