中文

基于动力学距离学习的自动目标生成

人工智能 2021-11-09 v1 机器人学

摘要

强化学习(RL)智能体可以通过与环境交互来学习解决复杂的序贯决策任务。然而,样本效率仍然是一个主要挑战。在多目标 RL 领域,智能体需要达到多个目标以解决复杂任务,提高样本效率尤其具有挑战性。另一方面,人类或其他生物智能体以更具策略性的方式学习此类任务,遵循一种课程式方法,其中任务按难度递增进行采样,以实现渐进且高效的学习进展。在本工作中,我们提出一种利用动力学距离函数(DDF)以自监督方式进行自动目标生成的方法。DDF 是一个预测马尔可夫决策过程(MDP)中任意两个状态之间动力学距离的函数。借此,我们生成适当难度级别的目标课程,以在整个训练过程中促进高效学习。我们在多个目标条件机器人操控与导航任务上评估该方法,并显示出相比仅使用随机目标采样的基线方法在样本效率上的提升。

关键词

引用

@article{arxiv.2111.04120,
  title  = {Automatic Goal Generation using Dynamical Distance Learning},
  author = {Bharat Prakash and Nicholas Waytowich and Tinoosh Mohsenin and Tim Oates},
  journal= {arXiv preprint arXiv:2111.04120},
  year   = {2021}
}