探索重启分布
机器学习
2020-08-19 v3 人工智能
机器学习
摘要
我们考虑一种通用方法,即利用经验记忆库通过自适应重启分布来辅助探索。具体而言,在能够将状态重置为智能体过去观测对应状态的能力下,我们通过从更多样化的初始状态集合重启智能体以促进更快的状态空间覆盖,并允许其在与显著过往经验相关的状态中重启,从而辅助探索。该方法与同策略和异策略方法均兼容。然而,一个需要注意的问题是,改变初始状态分布可能在受限策略类内搜索时改变最优策略。为减轻这种非预期的学习偏差,我们在深度强化学习中评估该方法,其受益于深度神经网络的高表征能力。我们实例化了该方法的三种变体,每种均受经验回放中某一思想的启发。利用这些变体,我们表明可以获得性能提升,尤其在困难探索问题中。
引用
@article{arxiv.1811.11298,
title = {Exploring Restart Distributions},
author = {Arash Tavakoli and Vitaly Levdik and Riashat Islam and Christopher M. Smith and Petar Kormushev},
journal= {arXiv preprint arXiv:1811.11298},
year = {2020}
}
备注
RLDM 2019