中文

强化学习中的定向探索

机器学习 2019-06-20 v1 人工智能 机器学习

摘要

高效的探索对于一般而言的强化学习取得良好样本效率是必要的。从小型表格环境(如网格世界)到大型连续稀疏奖励环境(如机器人物体操控任务),当不确定性能够准确驱动探索朝向有前景的状态时,通过对奖励函数添加不确定性奖励的方式已被证明是有效的。然而奖励奖励仍可能低效,因为它们是非平稳的,这意味着当不确定性变化时我们必须等待函数逼近器再次追上并收敛。我们提出定向探索的思想,即学习一个目标条件策略,其中目标仅为其他状态,并利用它直接尝试到达具有大不确定性的状态。该目标条件策略独立于不确定性,因此是平稳的。我们在实验中展示定向探索比向奖励添加奖励更高效,且对不确定性如何计算更为鲁棒。

关键词

引用

@article{arxiv.1906.07805,
  title  = {Directed Exploration for Reinforcement Learning},
  author = {Zhaohan Daniel Guo and Emma Brunskill},
  journal= {arXiv preprint arXiv:1906.07805},
  year   = {2019}
}