基于确定性策略与有限演示学习复杂操作技能
机器人学
2023-03-30 v1 人工智能
摘要
结合演示,深度强化学习可高效地为机械臂开发策略。然而,在实践中收集充足的高质量演示耗时费力。且人类演示可能不适合机器人。非马尔可夫过程与对演示的过度依赖是进一步的挑战。例如,我们发现强化学习智能体在操作任务中对演示质量敏感,且难以直接适应来自人类的演示。因此,利用低质量且不足的演示来辅助强化学习训练更优策略具有挑战性,且有时有限的演示甚至导致更差的性能。我们提出一种名为 TD3fG(TD3 learning from a generator,从生成器学习的 TD3)的新算法以解决这些问题。它在从专家学习到从经验学习之间形成了平滑过渡。该创新可帮助智能体提取先验知识,同时降低演示的不利影响。我们的算法在具有有限演示的 Adroit 机械臂与 MuJoCo 任务中表现良好。
引用
@article{arxiv.2303.16469,
title = {Learning Complicated Manipulation Skills via Deterministic Policy with Limited Demonstrations},
author = {Liu Haofeng and Chen Yiwen and Tan Jiayi and Marcelo H Ang},
journal= {arXiv preprint arXiv:2303.16469},
year = {2023}
}