中文

Optimus-3:双路由对齐的混合专家智能体,具双粒度推理感知策略优化

人工智能 2026-02-11 v2

摘要

开发能够在视觉丰富、动态环境中解决开放性任务的通用智能体是具身 AI 的核心目标。虽然 Minecraft 已成为引人注目的基准,但现有智能体常因认知能力碎片化,缺乏反射执行(System 1)与深入推理(System 2)之间的协同。本文介绍 Optimus-3,一个将这些双重能力在统一框架中有机集成的通用智能体。为实现此目标,我们解决了三个根本性挑战。首先,为克服推理数据稀缺,我们提出了知识增强的自动数据生成管道。它从原始的 System 1 交互轨迹中合成高质量的 System 2 推理轨迹,通过注入领域知识有效缓解幻觉问题。我们公开了 resulting 数据集,\textbf{OptimusM4^{4}}。其次,为调和双系统的离散计算需求,我们设计了双路由对齐的混合专家架构。它采用任务路由器通过参数解耦防止任务干扰,层路由器动态调节推理深度,为 System 1 创建计算的“快速路径”,为 System 2 创建“深层路径”。最后,为激活 System 2 的推理能力,我们提出了双粒度推理感知策略优化(DGRPO)算法。它通过双粒度稠密奖励实现过程-结果协监督,确保思考过程与答案之间的一致性。广泛的评估表明,Optimus-3 在 System~2(规划提升 21%,描述提升 66%,具身问答提升 76%,定位提升 3.4 倍,反思提升 18%)和 System~1(长期动作提升 3%)任务上均超越现有最先进方法,并在开放性任务中实现了显著的 60% 成功率。

关键词

引用

@article{arxiv.2506.10357,
  title  = {Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization},
  author = {Zaijing Li and Yuquan Xie and Rui Shao and Gongwei Chen and Weili Guan and Dongmei Jiang and Yaowei Wang and Liqiang Nie},
  journal= {arXiv preprint arXiv:2506.10357},
  year   = {2026}
}

备注

16 pages, 12 figures