中文

优化面向推抓任务的深度强化学习长期行为

机器学习 2022-04-08 v1 计算机视觉与模式识别 机器人学

摘要

我们研究了 Zeng 等人的“面向抓取的视觉推放” (VPG) 系统以及 Ewerton 等人的“Hourglass”系统(前者的一种演进)。我们工作的重点是研究这两个系统学习长期奖励与策略的能力。Zeng 等人的原始任务仅需有限的预见能力。Ewerton 等人使用仅考虑最直接动作的智能体获得了最佳性能。我们感兴趣的是其模型和训练算法准确预测长期 Q 值的能力。为了评估这一能力,我们设计了一项新的分拣任务和奖励函数。我们的任务要求智能体准确估计未来奖励,因此在 Q 值计算中使用高折扣因子。我们研究了 VPG 训练算法的一种改进在我们任务上的行为。我们表明,该改进无法准确预测所需的长期动作序列。除了 Ewerton 等人指出的局限性外,它还受到已知的深度 Q 学习中 Q 值高估问题的困扰。为了解决我们的任务,我们转向 Hourglass 模型并将其与 Double Q-Learning 方法相结合。我们表明,当使用大折扣因子训练时,该方法使模型能够准确预测长期动作序列。我们的结果表明,Double Q-Learning 技术对于在极高折扣因子下训练是必不可少的,否则模型的 Q 值预测会发散。我们还实验了不同的折扣因子调度、损失计算和探索过程方法。结果表明,后述因素对我们任务的模型性能没有明显影响。

关键词

引用

@article{arxiv.2204.03487,
  title  = {Optimizing the Long-Term Behaviour of Deep Reinforcement Learning for Pushing and Grasping},
  author = {Rodrigo Chau},
  journal= {arXiv preprint arXiv:2204.03487},
  year   = {2022}
}