中文

利用回报序列方差构建探索策略

机器学习 2020-11-18 v1 人工智能

摘要

本文提出一种利用回报序列的加权方差或加权时序差分(TD)误差来构建探索策略上界的方法。我们证明,特定状态-动作对的回报序列方差是一个重要的信息源,可用于引导强化学习中的探索。其直观含义是:回报序列的波动表明近期未来回报具有更大的不确定性。这种差异源于基于价值的强化学习的循环特性;演化的价值函数催生策略改进,而策略改进又反过来修改价值函数。尽管方差与 TD 误差捕捉了这种不确定性的不同方面,我们的分析表明二者均可用于引导探索。我们提出一种双流网络架构,在 DQN 智能体中估计加权方差/TD 误差以实现我们的探索方法,并表明其在广泛的 Atari 游戏上优于基线。

关键词

引用

@article{arxiv.2011.08649,
  title  = {Leveraging the Variance of Return Sequences for Exploration Policy},
  author = {Zerong Xi and Gita Sukthankar},
  journal= {arXiv preprint arXiv:2011.08649},
  year   = {2020}
}