中文

Vision-Zero:通过战略性游戏化自我对弈实现可扩展的视觉语言模型自我改进

计算机视觉与模式识别 2026-03-05 v2 人工智能

摘要

虽然强化学习 (RL) 已被证明是改进视觉语言模型 (VLM) 和多模态大型语言模型 (MLLM) 的有前景的方法,但当前方法高度依赖人工策划的数据集和高昂的人类验证成本,这限制了多模态系统的可扩展自我改进。为此,我们提出 Vision-Zero,一个无标签、领域中立的多智能体自我对弈框架,通过从任意图像输入生成的竞争性视觉游戏实现自我演化的 VLMs。具体而言,Vision-Zero 包含三个主要特性:(1) 战略性自我对弈框架:Vision-Zero 在“谁是间谍”风格的游戏中训练 VLMs,让模型在多个角色之间进行战略推理和行动。通过交互式游戏,模型自主生成训练数据,无需人工标注。(2) 来自任意图像的游戏生成:与现有游戏化框架不同,Vision-Zero 可以从任意图像生成游戏,从而增强模型在不同领域的推理能力,并显示出对不同任务的强大概括能力。我们使用三种不同类型的图像数据集演示了这种多样性:基于 CLEVR 的合成场景、图表以及真实世界图像。(3) 可持续的性能提升:我们引入迭代自我对弈策略优化 (Iterative-SPO),这是一种新颖的训练算法,在自我对弈和带可验证奖励的强化学习 (RLVR) 之间交替进行,从而缓解自我对弈-only 训练中常见的性能平台期,实现持久的长期改进。尽管使用无标签数据,Vision-Zero 在推理、图表问答和视觉中心理解任务上实现了最先进的性能,超越了其他基于标注的方法。模型和代码已在 https://github.com/wangqinsi1/Vision-Zero 上发布。

关键词

引用

@article{arxiv.2509.25541,
  title  = {Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play},
  author = {Qinsi Wang and Bo Liu and Tianyi Zhou and Jing Shi and Yueqian Lin and Yiran Chen and Hai Helen Li and Kun Wan and Wentian Zhao},
  journal= {arXiv preprint arXiv:2509.25541},
  year   = {2026}
}

备注

ICLR 2026