具有延迟传感器测量的引导策略搜索
机器人学
2017-10-03 v2
摘要
引导策略搜索是一种强化学习方法,它通过多个引导分布来引导策略的学习,从而训练出一个用于完成给定任务的通用策略。引导策略搜索依赖于学习环境的底层动力学模型,随后在算法的每次迭代中使用该模型来逐步改进策略。然而,该模型通常假设环境动力学是马尔可夫的,例如仅依赖于当前状态和控制信号。在本文中,我们将引导策略搜索应用于具有非马尔可夫动力学的问题。具体而言,我们将其应用于将精确量液体从杯子倒入碗中的问题,其中许多传感器测量存在不可忽略的延迟。我们表明,通过相对简单的状态增广,引导策略搜索可以扩展到由延迟传感器读数导致非马尔可夫性的非马尔可夫动力学系统。
引用
@article{arxiv.1609.03076,
title = {Guided Policy Search with Delayed Sensor Measurements},
author = {Connor Schenck and Dieter Fox},
journal= {arXiv preprint arXiv:1609.03076},
year = {2017}
}
备注
2016 Quals Report for Connor Schenck in the Department of Computer Science & Engineering at the University of Washington