MM-Zero:从零数据开始的自演化多模型视觉语言模型
计算机视觉与模式识别
2026-03-11 v1 机器学习
摘要
自演化已成为改进基础模型(如大型语言模型 LLM 和视觉语言模型 VLM)的关键范式,这类模型可通过最小的人类干预实现提升。虽然最近的研究表明 LLM 智能体可从零或几乎没有数据开始自我演化,但 VLM 由于引入了额外的视觉模态,通常需要至少一些种子数据(如图像)来引导自我演化过程。本文提出了 Multi-model Multimodal Zero(MM-Zero),这是第一个实现 VLM 零数据自我演化的基于强化学习的框架。超越以往双角色(提议者和求解者) setup,MM-Zero 引入由三个专门角色组成的多角色自我演化训练框架:提议者生成抽象的视觉概念并构建问题;编码器将这些概念转化为可执行代码(如 Python、SVG)以渲染视觉图像;求解者对生成的视觉内容进行多模态推理。所有三个角色均从相同的基础模型初始化,并使用群体相对策略优化(GRPO)进行训练,设计了将执行反馈、视觉验证和难度平衡集成的奖励机制。我们的实验表明,MM-Zero 在广泛的多模态基准测试中提升了 VLM 推理性能。MM-Zero 建立了一条可扩展的路径,实现多角色系统的自我演化,为多模态模型开拓了新边界,超越了传统两种模型范式的常规自我改进框架。
引用
@article{arxiv.2603.09206,
title = {MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data},
author = {Zongxia Li and Hongyang Du and Chengsong Huang and Xiyang Wu and Lantao Yu and Yicheng He and Jing Xie and Xiaomin Wu and Zhichao Liu and Jiarui Zhang and Fuxiao Liu},
journal= {arXiv preprint arXiv:2603.09206},
year = {2026}
}