V-tableR1:基于评论家引导策略优化的过程监督多模态表格推理
人工智能
2026-04-23 v1 机器学习
摘要
我们引入了 V-tableR1,这是一个过程监督的强化学习框架,旨在从多模态大语言模型中引出严谨、可验证的推理。当前仅基于最终结果训练的多模态大语言模型通常将视觉推理视为黑箱,依赖于表面的模式匹配而非执行严谨的多步推理。虽然带有可验证奖励的强化学习可以强制产生透明的推理轨迹,但将其扩展到视觉领域仍然受到将抽象逻辑锚定到连续像素空间中的模糊性的严重阻碍。我们通过利用表格的确定性网格结构作为理想的视觉测试平台来解决这个问题。V-tableR1 使用一个专门的评论家视觉语言模型,为由策略视觉语言模型生成的显式视觉思维链提供密集的、步骤级的反馈。为了优化这个系统,我们提出了过程引导的直接对齐策略优化,这是一种新颖的强化学习算法,集成了过程奖励、解耦策略约束和长度感知的动态采样。广泛的评估表明,V-tableR1 明确惩罚了视觉幻觉和捷径猜测。通过从根本上将多模态推理从黑箱模式匹配转变为可验证的逻辑推导,V-tableR1 4B 在复杂的表格基准测试中,在开源模型中达到了最先进的准确率,其性能优于规模高达其 18 倍的模型,并且相对于其 SFT 基线有所提升。
引用
@article{arxiv.2604.20755,
title = {V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization},
author = {Yubo Jiang and Yitong An and Xin Yang and Abudukelimu Wuerkaixi and Xuxin Cheng and Fengying Xie and Zhiguo Jiang and Cao Liu and Ke Zeng and Haopeng Zhang},
journal= {arXiv preprint arXiv:2604.20755},
year = {2026}
}
备注
15 pages, 4 figures, 4 tables