中文

重新审视优先经验回放:一种价值视角

机器学习 2021-02-08 v1

摘要

经验回放使得离策略强化学习(RL)智能体能够利用过往经验来最大化累积奖励。优先经验回放依据经验的时间差分误差幅度(TD|\text{TD}|)对经验赋权,显著提升了学习效率。但 TD|\text{TD}| 与经验重要性之间的关系尚不清晰。我们从经济学视角解决该问题,将 TD|\text{TD}| 与经验价值相联系,后者定义为通过访问该经验为累积奖励所增加的价值。我们从理论上证明,对于Q-learning,经验的价值度量由上界 TD|\text{TD}| 限定。此外,我们通过推导软Q-learning中这些价值度量的下界和上界,成功将理论框架扩展至最大熵RL,这些界恰好是 TD|\text{TD}| 与经验“on-policyness”的乘积。我们的框架联系了RL中两个重要量:TD|\text{TD}| 与经验价值。我们通过实验表明这些界在实践中成立,并且以该上界作为优先级的经验回放改进了Atari游戏中的最大熵RL。

关键词

引用

@article{arxiv.2102.03261,
  title  = {Revisiting Prioritized Experience Replay: A Value Perspective},
  author = {Ang A. Li and Zongqing Lu and Chenglin Miao},
  journal= {arXiv preprint arXiv:2102.03261},
  year   = {2021}
}

备注

Under Review