Active-O3:通过 GRPO 赋予多模态大语言模型主动感知能力
计算机视觉与模式识别
2025-05-28 v1 人工智能
摘要
主动视觉,又称主动感知,是指主动选择看向何处以及如何看,以收集与任务相关的信息的过程。它是人类和高级具身智能体高效感知与决策的关键组成部分。近期,将多模态大语言模型(MLLM)作为机器人系统中央规划与决策模块的做法引起了广泛关注。然而,尽管主动感知在具身智能中很重要,关于如何赋予 MLLM 主动感知能力或使其学习主动感知能力的探索却少之又少。在本文中,我们首先系统定义了基于 MLLM 的主动感知任务。我们指出,近期提出的 GPT-o3 模型的放大搜索策略可以被视为主动感知的一个特例;然而,它仍然存在搜索效率低和区域选择不准确的问题。为了解决这些问题,我们提出了 ACTIVE-O3,一个基于 GRPO 构建的纯强化学习训练框架,旨在赋予 MLLM 主动感知能力。我们进一步建立了一个全面的基准测试套件,以在通用开放世界任务(如小目标与密集目标定位)和特定领域场景(包括遥感与自动驾驶中的小目标检测,以及细粒度交互式分割)中评估 ACTIVE-O3。此外,ACTIVE-O3 在 V* Benchmark 上也展现出强大的零样本推理能力,而无需依赖任何显式推理数据。我们希望我们的工作能提供简单的代码库和评估协议,以促进未来关于 MLLM 主动感知的研究。
引用
@article{arxiv.2505.21457,
title = {Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO},
author = {Muzhi Zhu and Hao Zhong and Canyu Zhao and Zongze Du and Zheng Huang and Mingyu Liu and Hao Chen and Cheng Zou and Jingdong Chen and Ming Yang and Chunhua Shen},
journal= {arXiv preprint arXiv:2505.21457},
year = {2025}
}
备注
Project Page: https://aim-uofa.github.io/ACTIVE-o3