中文

Mini-o3:放大视觉搜索的推理模式和交互轮次

计算机视觉与模式识别 2025-09-10 v1 人工智能 计算与语言

摘要

最近的大型多模态模型研究利用基于图像的工具结合强化学习来解决视觉问题,但现有的开源方法往往表现出单调的推理模式,且仅允许有限的交互轮次,这在需要试错探索的困难任务方面不够。为此,我们放大了工具式交互,引入 Mini-o3,一个执行深层、多轮推理——跨越数十步——的系统,在具有挑战性的视觉搜索任务上实现了最先进的性能。我们复现 OpenAI o3 风格行为的配方包括三个关键组件:首先,我们构建了视觉探针数据集,收集大量用于探索性推理的具有挑战性的视觉搜索问题;其次,我们开发了迭代式数据收集管道,以获得展现多样化推理模式(包括深度优先搜索、试错和目标维护)的冷启动轨迹;最后,我们提出一种 over-turn 掩码策略,在强化学习期间不对超过最大轮次的响应进行惩罚,从而在训练时效率与测试时可扩展性之间取得平衡。尽管仅以上限为 6 个交互轮次进行训练,我们的模型在推理时能够自然扩展到数十个轮次,且随着轮次数量增加而提升准确率。广泛的实验表明,Mini-o3 产生丰富的推理模式和深层思考路径,有效解决了具有挑战性的视觉搜索问题。

关键词

引用

@article{arxiv.2509.07969,
  title  = {Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search},
  author = {Xin Lai and Junyi Li and Wei Li and Tao Liu and Tianjian Li and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2509.07969},
  year   = {2025}
}

备注

Code, datasets, models are available at https://github.com/Mini-o3/Mini-o3. Project Page: https://mini-o3.github.io/