中文

VReST:通过树搜索与自奖励机制增强大视觉语言模型的推理能力

计算机视觉与模式识别 2025-06-11 v1

摘要

大视觉语言模型(LVLMs)在多模态任务中表现出色,但其在复杂视觉推理方面的有效性仍受限制,尤其是在使用思维链提示技术时。在本文中,我们提出VReST,一种新颖的无训练方法,通过蒙特卡洛树搜索和自奖励机制来增强LVLMs的推理能力。VReST通过构建搜索树精心遍历推理空间,其中每个节点封装一个推理步骤,每条路径描绘一个完整的推理序列。我们创新的多模态自奖励机制通过整合子问题的效用、答案正确性以及视觉语言线索的相关性来评估推理步骤的质量,而无需额外的模型。VReST超越了当前的提示方法,并在三个多模态数学推理基准上取得了最先进性能。此外,它证实了多模态任务中测试时缩放定律的有效性,为未来研究提供了一个有前景的方向。

关键词

引用

@article{arxiv.2506.08691,
  title  = {VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism},
  author = {Congzhi Zhang and Jiawei Peng and Zhenglin Wang and Yilong Lai and Haowen Sun and Heng Chang and Fei Ma and Weijiang Yu},
  journal= {arXiv preprint arXiv:2506.08691},
  year   = {2025}
}

备注

Accepted by ACL 2025 main