结构化探索策略的元强化学习
机器学习
2018-02-21 v1 人工智能
神经与进化计算
摘要
探索是强化学习(RL)中的基本挑战。当前许多深度 RL 的探索方法使用与任务无关的目标,例如信息增益或基于状态访问的奖励。然而,RL 的许多实际应用涉及学习不止单个任务,且先前的任务可用于告知新任务中应如何执行探索。在本工作中,我们探究先前的任务如何告知智能体在新情境中有效探索的方法。我们引入一种新颖的基于梯度的快速适应算法——带结构化噪声的模型无关探索(MAESN)——以从先验经验中学习探索策略。先验经验既用于初始化策略,也用于获取可向策略中注入结构化随机性的潜在探索空间,从而产生由先验知识告知且比随机动作空间噪声更有效的探索策略。我们表明,与先前的元 RL 方法、无学习探索策略的 RL 以及任务无关探索方法相比,MAESN 在学习探索策略上更为有效。我们在多种模拟任务上评估了我们的方法:带轮机器人的运动、四足行走机器人的运动以及物体操控。
引用
@article{arxiv.1802.07245,
title = {Meta-Reinforcement Learning of Structured Exploration Strategies},
author = {Abhishek Gupta and Russell Mendonca and YuXuan Liu and Pieter Abbeel and Sergey Levine},
journal= {arXiv preprint arXiv:1802.07245},
year = {2018}
}