中文

分层过程奖励模型是符号视觉学习器

计算机视觉与模式识别 2025-12-04 v1

摘要

符号计算机视觉通过显式逻辑规则和结构化表示来表示图表,从而实现机器视觉中的可解释理解。这需要与基于像素的视觉模型根本不同的学习范式。符号视觉学习器将图表解析为几何基元——点、线和形状——而基于像素的学习器则作用于纹理和颜色。我们提出了一种新颖的自监督符号自编码器,将图表编码为潜在空间中的结构化基元及其相互关系,并通过我们的可执行引擎进行解码以重建输入图表。该架构的核心是符号分层过程奖励建模,它应用分层步骤级解析奖励来强制点在线上、线在形状上以及形状在关系上的一致性。由于标准强化学习在图表重建的策略空间中表现出较差的探索性,我们因此引入了稳定机制来平衡探索与利用。我们对符号编码器进行下游任务的微调,开发了一个神经符号系统,通过基于推理的视觉奖励将神经网络的推理能力与符号模型的可解释性相结合。在重建、感知和推理任务上的评估证明了该方法的有效性:在几何图表重建中实现了98.2%的MSE降低,在图表重建中以7B模型超越GPT-4o 0.6%,在MathGlance感知基准上提升13%,在MathVerse和GeoQA推理基准上提升3%。

关键词

引用

@article{arxiv.2512.03126,
  title  = {Hierarchical Process Reward Models are Symbolic Vision Learners},
  author = {Shan Zhang and Aotian Chen and Kai Zou and Jindong Gu and Yuan Xue and Anton van den Hengel},
  journal= {arXiv preprint arXiv:2512.03126},
  year   = {2025}
}