中文

MMC:基于 MCTS 的多模态批判性细化 VLM 推理

多媒体 2025-04-16 v1

摘要

视觉语言模型(VLMs)在多种多模态推理任务中表现出强大的能力,但仍面临如幻觉等挑战,导致推理结果不正确。灵感来自最近在大语言模型(LLMs)中关于外部反馈机制的研究,我们提出一种多模态演员-评论家框架来增强 VLM 的推理能力。具体而言,演员模型基于图像和文本输入生成逐步推理路径,而评论家模型评估这些推理路径并提供纠正反馈。演员模型会在评论家模型认为推理结果满意之前,不断基于反馈迭代细化其推理。为减少对昂贵手动标注的依赖,我们引入一种自动构建多模态批判数据集的方法。通过利用蒙特卡洛树搜索(MCTS),我们系统性地引导演员模型探索多样化的推理路径。为获得纠正错误推理步骤的批判数据,我们提示一个注释模型比较来自共享祖先节点的两条推理路径——一条导致正确结论,另一条导致错误结论。该方法使我们能够构建MMC(MCTS-based Multimodal Critique)数据集,并在此基础上开发出完整的训练和推理管道。在多个公开基准数据集和主流 VLMs 上进行的广泛实验表明,我们的方法显著提升了 VLM 在复杂多模态推理任务上的性能,凸显了其有效性和广泛适用性。

关键词

引用

@article{arxiv.2504.11009,
  title  = {MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique},
  author = {Shuhang Liu and Zhenrong Zhang and Pengfei Hu and Jiefeng Ma and Jun Du and Qing Wang and Jianshu Zhang and Quan Liu and Jianqing Gao and Feng Ma},
  journal= {arXiv preprint arXiv:2504.11009},
  year   = {2025}
}