中文

规模化任务,而非样本:通过多任务模型基强化学习掌握人形机器人控制

人工智能 2026-03-03 v1 机器人学

摘要

开发能够掌握多样化技能的通用机器人是具身 AI 中的核心挑战。虽然最近的进展强调规模化模型参数和离线数据集,但此类方法在机器人领域受限,因为学习需要主动交互。我们认为,有效的在线学习应规模化"任务数量",而非每个任务的样本数。此 regime 揭示了模型基强化学习 (MBRL) 的结构优势。由于物理动力学在不同任务间保持不变,共享的世界模型可以聚合多任务经验,以学习稳健、任务无关的表示。相比之下,模型无基方法在任务要求在相似状态下执行冲突动作时会遭受梯度干扰。因此,任务多样性可作为 MBRL 的正则化器,以提高动力学学习和样本效率。我们以 EfficientZero-Multitask (EZ-M) 为实现此想法的一个样本高效的多任务 MBRL 在线学习算法。评估于 HumanoidBench—a 个具备挑战性全身控制基准—EZ-M 以显著高于强基准的样本效率实现了最佳性能,无需极端参数规模。这些结果确立了任务规模作为可扩展机器人学习关键轴。项目网站可在 \href{https://yewr.github.io/ez_m/}{here}。

关键词

引用

@article{arxiv.2603.01452,
  title  = {Scaling Tasks, Not Samples: Mastering Humanoid Control through Multi-Task Model-Based Reinforcement Learning},
  author = {Shaohuai Liu and Weirui Ye and Yilun Du and Le Xie},
  journal= {arXiv preprint arXiv:2603.01452},
  year   = {2026}
}