用于杂乱环境中基于二维物理的物体操作的深度强化学习
机器人学
2023-12-11 v1
摘要
深度强化学习(Deep Reinforcement Learning, DRL)是一个快速发展的研究领域,植根于运筹学和行为心理学,其潜在应用扩展到包括机器人学在内的多个领域。本论文阐述了现代强化学习(Reinforcement Learning, RL)的背景,从马尔可夫决策过程、马尔可夫性质、目标和奖励、智能体-环境交互以及策略构成的框架开始。我们解释了RL中常用的主要算法类型,包括基于价值、策略梯度和演员-评论家方法,并特别强调了DQN、A2C和PPO。然后,我们对一些广泛采用的用于实现RL算法和环境的框架进行了简短的文献综述。随后,我们介绍了二维夹持器环境(Bidimensional Gripper Environment, BGE),这是一个基于我们开发的Pymunk物理引擎的虚拟模拟器,用于分析自上而下的二维物体操作。方法论部分将我们的智能体-环境交互框架化为一个马尔可夫决策过程,以便我们可以应用我们的RL算法。我们列出了各种目标制定策略,包括奖励塑形和课程学习。我们还采用了不同的观察预处理步骤来减少所需的计算工作量。在实验阶段,我们运行了一系列难度递增的场景。我们从一个简单的静态场景开始,然后逐渐增加随机性。每当智能体在学习中表现出困难时,我们就通过增加奖励塑形和课程学习的程度来应对。这些实验证明了无模型算法在动态变化下的巨大局限性和缺陷。最后,我们总结了我们的发现和评论。然后,我们概述了潜在的未来工作,以改进我们的方法并可能扩展到真实世界系统。
引用
@article{arxiv.2312.04570,
title = {Deep Reinforcement Learning for 2D Physics-Based Object Manipulation in Clutter},
author = {Luca Renna},
journal= {arXiv preprint arXiv:2312.04570},
year = {2023}
}