基于平行相对策略优化的 LVLMs 图表深度研究
计算机视觉与模式识别
2026-03-10 v1 人工智能
机器学习
摘要
随着数据科学的快速发展,图表从简单的数值展示工具演变为洞察发现和决策支持的必备工具。然而,当前的图表数据智能在深度研究能力方面存在显著局限,现有方法主要解决浅层任务,如视觉识别或事实问答,而非深度推理和高级数据分析所需的复杂推理。这种局限性源于两个主要技术瓶颈:在训练层面,现有的后训练技术在处理多维奖励信号干扰和异构数据梯度冲突方面存在不足,阻碍模型在多个能力维度上实现平衡发展;在评估层面,当前方法仅限于事实检索和基本计算,无法评估端到端分析推理和其他深度研究能力。为解决训练挑战,我们提出了 PRPO,通过在奖励维度上进行平行优化和数据类型上的能力分区,有效地解耦了异构数据与多维奖励信号之间的冲突,确保优化稳定性。在评估层面,我们基于“错误唯一性原则”构建了 MCDR-Bench,通过可控的错误注入将主观的生成评估转化为客观的错误识别,实现对深度研究能力的可量化评估。实验验证表明,提出的 PRPO 和 MCDR-Bench 共同构成了一个统一的框架,通过增强协同训练和客观评估,系统性地推进了图表深度研究。
引用
@article{arxiv.2603.06677,
title = {Chart Deep Research in LVLMs via Parallel Relative Policy Optimization},
author = {Jiajin Tang and Gaoyang and Wenjie Wang and Sibei Yang and Xing Chen},
journal= {arXiv preprint arXiv:2603.06677},
year = {2026}
}
备注
Accepted at ICLR 2026