重新审视优先经验回放:一种价值视角
机器学习
2021-02-08 v1
摘要
经验回放使得离策略强化学习(RL)智能体能够利用过往经验来最大化累积奖励。优先经验回放依据经验的时间差分误差幅度()对经验赋权,显著提升了学习效率。但 与经验重要性之间的关系尚不清晰。我们从经济学视角解决该问题,将 与经验价值相联系,后者定义为通过访问该经验为累积奖励所增加的价值。我们从理论上证明,对于Q-learning,经验的价值度量由上界 限定。此外,我们通过推导软Q-learning中这些价值度量的下界和上界,成功将理论框架扩展至最大熵RL,这些界恰好是 与经验“on-policyness”的乘积。我们的框架联系了RL中两个重要量: 与经验价值。我们通过实验表明这些界在实践中成立,并且以该上界作为优先级的经验回放改进了Atari游戏中的最大熵RL。
引用
@article{arxiv.2102.03261,
title = {Revisiting Prioritized Experience Replay: A Value Perspective},
author = {Ang A. Li and Zongqing Lu and Chenglin Miao},
journal= {arXiv preprint arXiv:2102.03261},
year = {2021}
}
备注
Under Review