中文

物流场景中基于视觉观测的机器人顺序拣选任务的无监督奖励塑形

机器人学 2023-05-30 v3 机器学习 系统与控制 系统与控制

摘要

我们关注物流行业中典型的卸载问题,将其建模为顺序拾放任务。在这类任务中,现代机器学习技术已被证明优于经典系统,因为它们对随机性更具适应性,且更能应对大的不确定性。更具体地说,监督学习与模仿学习在这方面取得了出色的结果,其缺陷是需要某种形式的监督,而这种监督并非在所有环境中都能获得。另一方面,强化学习(RL)所需的监督形式温和得多,但仍因其低效而难以实用。在本文中,我们提出并从理论上论证了一种基于专家观测的新型无监督奖励塑形算法,它放宽了智能体所需的监督程度,并致力于提升 RL 在我们任务中的性能。

关键词

引用

@article{arxiv.2209.12350,
  title  = {Unsupervised Reward Shaping for a Robotic Sequential Picking Task from Visual Observations in a Logistics Scenario},
  author = {Vittorio Giammarino and Andrew J Meyer and Kai Biegun},
  journal= {arXiv preprint arXiv:2209.12350},
  year   = {2023}
}