中文

V-Zero:零标注下的自提升多模态推理

计算机视觉与模式识别 2026-01-16 v1 人工智能 机器学习

摘要

多模态学习的最新进展显著增强了视觉语言模型(VLM)的推理能力。然而,最先进的方法严重依赖大规模人工标注数据集,获取这些数据成本高昂且耗时。为克服这一限制,我们提出了V-Zero,一个通用的后训练框架,仅利用无标签图像实现自我提升。V-Zero通过实例化两个不同的角色:提问者(Questioner)和求解者(Solver),建立了一个共同进化循环。提问者利用双轨推理奖励机制(对比直觉猜测与推理结果)学习合成高质量、具有挑战性的问题。求解者则使用基于其自身采样响应进行多数投票得到的伪标签进行优化。两个角色通过分组相对策略优化(GRPO)进行迭代训练,驱动相互增强的循环。值得注意的是,在没有任何人工标注的情况下,V-Zero在Qwen2.5-VL-7B-Instruct上实现了持续的性能提升,视觉数学推理能力提升+1.7,通用视觉中心能力提升+2.6,展示了多模态系统中自我提升的潜力。代码可在 https://github.com/SatonoDia/V-Zero 获取。

关键词

引用

@article{arxiv.2601.10094,
  title  = {V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation},
  author = {Han Wang and Yi Yang and Jingyuan Hu and Minfeng Zhu and Wei Chen},
  journal= {arXiv preprint arXiv:2601.10094},
  year   = {2026}
}