中文

DreamPolicy:面向可扩展人类 locomotion 的统一世界模型策略

机器人学 2026-05-13 v3 机器学习

摘要

实现单一策略以实现多样化的人类 locomotion 是一个关键的可扩展性挑战。先前的方法往往依赖将多个 terrain-specific 教师策略蒸馏到统一的学生策略。然而,尽管这种蒸馏捕获了基本的 locomotion 原语,但在复杂环境下难以有机地组合这些技能以适应训练期未见的 novel composite terrains,导致其在未见复合 terrain 上的泛化能力较差。为克服此限制,我们提出 DreamPolicy,一个统一框架,集成离线数据与基于扩散的 world model,使单个策略能够掌握已知和未知 terrain。我们方法的核心是 terrain-aware world model,由在 specialized policies 的 rollout 聚合数据上训练的自回归扩散 world model 驱动。该 model synthesizes 物理上合乎逻辑的未来轨迹,这些轨迹作为条件化 policy 的 dynamic objective,从而绕过 manual reward engineering。不同于蒸馏方法,our world model 捕获可泛化的 locomotion 技能,使其能够对未见 composite terrains 实现 robust zero-shot transfer。DreamPolicy 自然随数据可用性而扩展。随着离线数据集的扩大,扩散 world model 持续获取更丰富的技能。实验表明,DreamPolicy 在未见 terrain 上比最强 baseline 性能提升最高达 27%,在 combined terrain 上提升最高达 38%。通过将 world model-based planning 与 policy learning 统一,DreamPolicy 打破了“一任务一策略”的瓶颈,建立了可扩展、数据驱动的通用人类控制范式。

关键词

引用

@article{arxiv.2505.18780,
  title  = {DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion},
  author = {Yahao Fan and Tianxiang Gui and Kaiyang Ji and Shutong Ding and Chixuan Zhang and Yifeng Xu and Ke Yang and Jiayuan Gu and Jingyi Yu and Jingya Wang and Ye Shi},
  journal= {arXiv preprint arXiv:2505.18780},
  year   = {2026}
}