中文

学习探索策略以解决真实世界弹珠轨道任务

机器人学 2023-03-10 v1

摘要

涉及局部不稳定或间断动力学(如分岔和碰撞)的任务在机器人领域仍具挑战性,因为环境的微小变化会对任务结果产生显著影响。对于此类任务,学习鲁棒的确定性策略是困难的。我们专注于基于混合专家(MoE)策略表示来构建由多个随机策略组成的探索结构,该表示可高效适配。MoE策略由随机子策略和高层选择策略组成,随机子策略允许探索动作空间(或策略)的多个不同区域,高层选择策略引导探索朝向最有前景的区域。我们开发了一个机器人系统,在真实世界物理问题求解领域中评估我们的方法。在仿真中训练MoE策略后,真实世界中的在线学习在仅数十次尝试内即展现出高效适配,且sim2real差距极小。我们的结果证实,表示多种策略促进了在新环境中的高效适配,且在不同动力学下学习的策略仍可提供关于在何处寻找优良策略的有用信息。

关键词

引用

@article{arxiv.2303.04928,
  title  = {Learning Exploration Strategies to Solve Real-World Marble Runs},
  author = {Alisa Allaire and Christopher G. Atkeson},
  journal= {arXiv preprint arXiv:2303.04928},
  year   = {2023}
}