中文

无需人工标注的自改进 VLM 评判模型

计算机视觉与模式识别 2025-12-08 v1

摘要

有效的视觉-语言模型(VLM)评判模型对模型开发至关重要。目前训练 VLM 评判模型的方法主要依赖大规模人工偏好标注。然而,这种方法成本高昂,且随着模型的快速迭代,标注容易过时。在本工作中,我们提出了一种无需任何人工偏好标注即可自训练 VLM 评判模型的框架,仅使用自合成数据。我们的方法是迭代的,包含三个阶段:(1)生成具有不同质量水平的多样化多模态指令-响应对,(2)为每对生成推理轨迹和评判结果,移除不符合预期质量水平的样本,(3)使用正确的评判答案及其推理轨迹进行训练。我们在 Multimodal RewardBench 和 VL-RewardBench 上评估了所得评判模型,涵盖正确性、偏好、推理、安全性和视觉问答等维度。我们的方法将 Llama-3.2-11B 多模态评判模型在 VL-RewardBench 上的整体准确率从 0.38 提升至 0.51,经常超越包括 Llama-3.2-90B、GPT-4o 和 Claude 3.5 Sonnet 在内的更大模型,在通用性、幻觉和推理维度上表现尤为突出。这些无人标注结果的整体优势表明,未来有可能出现与快速发展的 VLM 能力同步演化的自评判模型。

关键词

引用

@article{arxiv.2512.05145,
  title  = {Self-Improving VLM Judges Without Human Annotations},
  author = {Inna Wanyin Lin and Yushi Hu and Shuyue Stella Li and Scott Geng and Pang Wei Koh and Luke Zettlemoyer and Tim Althoff and Marjan Ghazvininejad},
  journal= {arXiv preprint arXiv:2512.05145},
  year   = {2025}
}