中文

Q-CP:用于协同规划的动作价值学习

机器人学 2018-03-02 v1 人工智能

摘要

多机器人系统的研究已在众多应用与领域中展现出可喜成果。然而,由于场景非结构化、高度不确定性以及状态维度巨大(例如超冗余机器人与机器人组),高效学习有效的机器人行为仍十分困难。为缓解该问题,我们提出一种基于模型的协同强化学习算法Q-CP,其利用动作价值来(1)引导状态空间的探索,以及(2)生成有效策略。具体而言,我们利用Q-learning在蒙特卡洛树搜索的迭代中应对维度灾难。我们在不同的随机协同(一般和)博弈上实现并评估了Q-CP:(1)3个机器人间的简单协同导航问题,(2)一对KUKA YouBot执行交接的协作场景,以及(3)两个移动机器人进门时的协调任务。所得结果表明Q-CP在所选应用中的有效性:动作价值驱动探索,降低了规划过程的计算需求,同时取得了良好性能。

关键词

引用

@article{arxiv.1803.00297,
  title  = {Q-CP: Learning Action Values for Cooperative Planning},
  author = {Francesco Riccio and Roberto Capobianco and Daniele Nardi},
  journal= {arXiv preprint arXiv:1803.00297},
  year   = {2018}
}