中文

SketchVL:通过细粒度信用分配进行策略优化的图表理解及更多应用

计算机视觉与模式识别 2026-01-12 v1

摘要

图表是高密度的复杂数据视觉载体,也是信息提取和分析的媒介。由于需要精确且复杂的视觉推理,自动化图表理解对现有多模态大语言模型(MLLMs)构成了重大挑战。许多使用强化学习(RL)训练的 MLLM 面临信用分配(credit assignment)的难题。它们的优势估计通常在轨迹层面进行,无法区分单个生成响应中正确与错误的推理步骤。为解决这一局限,我们引入了 SketchVL,这是一种新颖的 MLLM,通过 FinePO 进行优化。FinePO 是一种专为轨迹内细粒度信用分配而设计的新型 RL 算法。SketchVL 的方法论涉及将其中间推理步骤作为标记绘制在图像上,并将标注后的图像反馈给自身,从而创建一个鲁棒的多步推理过程。在训练期间,FinePO 算法利用细粒度过程奖励模型(FinePRM)对轨迹内的每个绘制动作进行评分,从而精确地为每一步分配信用。该机制使得 FinePO 能够在轨迹全局成功时更强地奖励正确 token,并在轨迹全局次优时更重地惩罚错误 token,从而实现细粒度的强化信号。实验表明,SketchVL 学会了使其步骤级行为与 FinePRM 对齐,在图表数据集、自然图像数据集和数学任务上,其性能平均比基础模型提升了 7.23%,为训练强大的推理模型提供了一个有前景的新方向。

关键词

引用

@article{arxiv.2601.05688,
  title  = {SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More},
  author = {Muye Huang and Lingling Zhang and Yifei Li and Yaqiang Wu and Jun Liu},
  journal= {arXiv preprint arXiv:2601.05688},
  year   = {2026}
}