中文

基于无监督强化学习的可提示人类机器人行为基础模型 BFM-Zero

机器人学 2025-11-07 v1

摘要

为人类机器人构建行为基础模型(BFM)有望在单一的可提示通用策略下统一多样化的控制任务。然而,现有方法要么仅在仿真人类角色上部署,要么专用于跟踪等特定任务。我们提出 BFM-Zero,一种学习有效共享潜表示的框架,将运动、目标和奖励嵌入常见空间,使单个策略能够通过无需重新训练的方式被提示用于多个下游任务。BFM-Zero 构建良好结构化的潜空间,使其在 Unitree G1 人体机器人上实现通过多样推理方法实现的通用且稳健的全身技能,包括零样运动跟踪、目标到达和奖励优化,以及少量基于优化的适应。与先前基于策略的强化学习(RL)框架不同,BFM-Zero 基于最新进展中的无监督 RL 和前向-后向(FB)模型,后者提供一种以目标为中心、可解释且平滑的全身运动潜表示。我们进一步扩展 BFM-Zero,集成关键奖励塑形、域随机化和历史依赖的非对称学习,以弥合仿真到现实的差距。这些关键设计选择在仿真中进行了量化消融实验。BFM-Zero 是首个实现可提示人类机器人全身控制的行为基础模型,为该领域的可扩展、可提示行为基础模型之路指明了方向。

关键词

引用

@article{arxiv.2511.04131,
  title  = {BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning},
  author = {Yitang Li and Zhengyi Luo and Tonghe Zhang and Cunxi Dai and Anssi Kanervisto and Andrea Tirinzoni and Haoyang Weng and Kris Kitani and Mateusz Guzek and Ahmed Touati and Alessandro Lazaric and Matteo Pirotta and Guanya Shi},
  journal= {arXiv preprint arXiv:2511.04131},
  year   = {2025}
}