稀疏奖励连续控制任务中的局部持久探索
机器学习
2021-06-15 v2
摘要
强化学习中的一个主要挑战是探索策略的设计,尤其是对于具有稀疏奖励结构以及连续状态和动作空间的环境。直观上,如果强化信号非常稀少,智能体应依赖某种形式的短期记忆以高效覆盖其环境。我们提出一种基于两点直觉的新探索方法:(1)下一个探索动作的选择不仅应取决于环境的(马尔可夫)状态,还应取决于智能体迄今的轨迹;(2)智能体应利用状态空间中的扩散度量以避免陷入小区域。我们的方法借助统计物理中常用于解释简化(聚合物)链行为的概念,以在状态空间中生成持久(局部自避)轨迹。我们讨论了局部自避行走的理论性质及其通过轨迹内衰减时间相关性提供某种短期记忆的能力。我们在模拟的2D导航任务以及更高维的MuJoCo稀疏奖励连续控制运动任务中提供了我们方法的经验评估。
引用
@article{arxiv.2012.13658,
title = {Locally Persistent Exploration in Continuous Control Tasks with Sparse Rewards},
author = {Susan Amin and Maziar Gomrokchi and Hossein Aboutalebi and Harsh Satija and Doina Precup},
journal= {arXiv preprint arXiv:2012.13658},
year = {2021}
}
备注
To be published in ICML, 2021