中文

基于无监督学习的四足机器人多样化技能发现

机器人学 2026-02-11 v1

摘要

强化学习需要专家精心设计奖励函数以激发目标行为,而模仿学习则依赖于高昂的任务特定数据。相比之下,无监督技能发现可通过内在动机学习出多样化且实用技能 repertoire,从而减轻这两种负担。然而,现有方法存在两个关键局限:它们通常依赖单一策略来掌握多样化行为集合,而未建模行为间的共享结构或差异,导致学习效率低;此外,容易出现奖励作弊,即奖励信号快速增长收敛,所学技能实际多样性不足。本文引入正交混合专家(OMoE)架构,防止多样化行为坍缩为重叠表征,使单个策略能够掌握广泛的 locomotion 技能。此外,我们设计多判别器框架,不同判别器 operate on 各自独立的观察空间,从而有效缓解奖励作弊。我们在 12-DOF Unitree A1 四足机器人上进行评估,展示了一组多样化的 locomotion 技能。我们的实验表明,所提出的框架提升了训练效率,并实现了基线 18.3% 的状态空间覆盖率扩展。

关键词

引用

@article{arxiv.2602.09767,
  title  = {Diverse Skill Discovery for Quadruped Robots via Unsupervised Learning},
  author = {Ruopeng Cui and Yifei Bi and Haojie Luo and Wei Li},
  journal= {arXiv preprint arXiv:2602.09767},
  year   = {2026}
}