Active Zero:通过主动环境探索构建自演化视觉语言模型
计算机视觉与模式识别
2026-02-13 v1 机器学习
摘要
自对弈技术使大语言模型能够通过自生成挑战实现自主提升。然而,现有视觉语言模型的自对弈方法依赖与静态图像集合的被动交互,导致对初始数据集的强依赖且学习效率低下。缺乏主动寻求符合自身能力边缘需求的视觉数据的能力,智能体会在平凡或超出当前技能水平的样本上浪费计算资源。为此,我们提出Active-Zero框架,构建从被动交互转向视觉环境主动探索的系统。Active-Zero采用三个协同演化的智能体:Searcher 从开放式资源库中检索符合模型能力边缘的图像,Questioner 合成校准的推理任务,Solver 通过准确性奖励进行优化。该闭环系统实现自我支架式自 curriculum 学习,使模型自主构建学习轨迹。在Qwen2.5-VL-7B-Instruct上测试12个基准,Active-Zero在推理任务上实现53.97的平均准确率(提升5.7%),在通用理解上达59.77(提升3.9%),持续优于现有自对弈基线方法。结果凸显主动探索是构建可扩展且自适应自演化视觉语言系统的关键要素。
引用
@article{arxiv.2602.11241,
title = {Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration},
author = {Jinghan He and Junfeng Fang and Feng Xiong and Zijun Yao and Fei Shen and Haiyun Guo and Jinqiao Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2602.11241},
year = {2026}
}