中文

利用路标映射状态空间以实现通用目标到达

机器学习 2019-08-16 v1 机器学习

摘要

一个充分理解环境的智能体应当能够将其技能应用于任意给定目标,这引出了学习通用值函数近似器(Universal Value Function Approximator, UVFA)这一基本问题。UVFA 学习预测所有状态-目标对之间的累积奖励。然而,经验上,长程目标的值函数总是难以估计,并可能因此导致策略失败。这给学习过程与神经网络的能力带来了挑战。我们提出一种方法,用于在具有稀疏奖励的大型 MDP 中解决此问题,其中跨远程状态的探索与路径规划都极为困难。我们的方法以分层方式显式建模环境,高层基于动态路标的地图抽象已访问的状态空间,低层值网络推导精确的局部决策。我们使用最远点采样从过往经验中选择路标状态,相较于简单均匀采样改善了探索。实验表明,我们的方法使智能体在训练早期即可到达长程目标,并在若干具有挑战性的任务上取得优于标准强化学习算法的性能。

关键词

引用

@article{arxiv.1908.05451,
  title  = {Mapping State Space using Landmarks for Universal Goal Reaching},
  author = {Zhiao Huang and Fangchen Liu and Hao Su},
  journal= {arXiv preprint arXiv:1908.05451},
  year   = {2019}
}