中文

MR. Judge:多模态推理器作为评判器

计算与语言 2025-05-20 v1

摘要

将大型语言模型(LLM)和多模态大型语言模型(MLLM)用作评估评判器的范式已在 RLHF 和推理时扩展中成为一种有效方法。在本工作中,我们提出了多模态推理器作为评判器(MR. Judge),一种通过赋予通用 MLLM 评判器强大推理能力的范式。与其直接为每个回答分配分数,我们将评判过程构建为一个受推理启发的多项选择题。具体而言,评判模型首先对回答的不同方面进行深思熟虑的推理,最终从中选择最佳回答。这一推理过程不仅提高了评判的可解释性,还显著增强了 MLLM 评判器的性能。为了应对缺乏带有评分回答的问题的情况,我们提出了以下策略来实现自动标注:1)反向回答候选合成:从监督微调(SFT)数据集出发,将原始回答视为最佳候选,并提示 MLLM 生成合理但有缺陷的负向候选。2)基于文本的推理提取:我们精心设计了一个数据合成流水线,从基于文本的推理模型中蒸馏推理能力,该模型被采用以使 MLLM 评判器通过预热监督微调重新获得复杂推理能力。实验表明我们的 MR. Judge 在广泛的任务中均有效。具体而言,我们的 MR. Judge-7B 在 VL-RewardBench 上超越了 GPT-4o 9.9%,并在推理时扩展中将 MM-Vet 上的性能提高了最多 7.7%。

关键词

引用

@article{arxiv.2505.13403,
  title  = {MR. Judge: Multimodal Reasoner as a Judge},
  author = {Renjie Pi and Felix Bai and Qibin Chen and Simon Wang and Jiulong Shan and Kieran Liu and Meng Cao},
  journal= {arXiv preprint arXiv:2505.13403},
  year   = {2025}
}