中文

分解、发现、部署:基于对称性和风格先验的因子化技能学习

机器人学 2025-09-01 v2

摘要

无监督技能发现 (USD) 允许智能体在没有任务特定奖励的情况下自主学习多样化的行为。虽然最近的USD方法显示出前景,但其在实际机器人上的应用仍受到关注。在本文中,我们提出一种模块化USD框架,以解决学习技能在安全性、可解释性和可部署性方面的挑战。我们的ethods 使用用户定义的状态空间因子化,以学习解耦的技能表示。它根据所需的内在奖励函数将不同的技能发现算法分配给每个因子。为鼓励结构化的、 morphology-aware 的技能,我们引入针对个体因子量身定制的对称性归纳偏置。我们还包含一个风格因子和正则化惩罚,以促进安全和稳健的行为。我们在仿真环境中使用四足机器人进行评估,并在零样本情况下将所学技能迁移到实际硬件。我们的实结果表明,因子化和对称性导致发现结构化的人类可解释行为,而风格因子和惩罚项提高了安全性和多样性。此外,我们展示所学技能可用于下游任务,性能与使用手工奖励训练的oracle策略相当。

关键词

引用

@article{arxiv.2508.19953,
  title  = {Divide, Discover, Deploy: Factorized Skill Learning with Symmetry and Style Priors},
  author = {Rafael Cathomen and Mayank Mittal and Marin Vlastelica and Marco Hutter},
  journal= {arXiv preprint arXiv:2508.19953},
  year   = {2025}
}

备注

Accepted to CoRL 2025. For code and videos, please check: https://leggedrobotics.github.io/d3-skill-discovery/