中文

利用子策略间的分歧学习仲裁人机控制

机器人学 2021-08-25 v1

摘要

在遥操作语境中,仲裁指的是决定如何融合人类和自主机器人指令。我们提出了一种强化学习解决方案,该方案学习一种最优仲裁策略,当机器人在任务中遇到决策点时,将更多控制权分配给人类。决策点是指机器人遇到多个选项(子策略)的地方,例如有多条路径绕过障碍物或在两个候选目标之间做出决定。通过将每个方向性子策略表示为 von Mises 分布,我们通过观察混合分布的多模态性来识别决策点。我们的奖励函数基于这种多模态性进行推理,并优先使其学习到的策略与用户或机器人指令相匹配。我们使用一个机器人操作臂,配合不同的模拟人类控制器,在抓取物体的遥操作实验上进行了报告。结果表明,我们的共享控制智能体优于直接控制,并提升了不同用户间的遥操作性能。使用我们的奖励项能够在保持安全、准确遥操作的同时,实现人类与机器人指令之间的灵活融合。

关键词

引用

@article{arxiv.2108.10634,
  title  = {Learning to Arbitrate Human and Robot Control using Disagreement between Sub-Policies},
  author = {Yoojin Oh and Marc Toussaint and Jim Mainprice},
  journal= {arXiv preprint arXiv:2108.10634},
  year   = {2021}
}