SIBRE:强化学习中用于自适应反馈的基于自我提升的奖励
机器学习
2020-12-22 v3 人工智能
机器学习
摘要
我们提出了一种通用的奖励塑造方法,用于提高强化学习 (RL) 中的收敛速度,称为基于自我提升的奖励 (Self Improvement Based REwards),或简称 SIBRE。该方法旨在与任何现有的 RL 算法结合使用,其核心是对智能体超越自身过去性能的提升给予奖励。我们证明了在与原始 RL 算法相同的条件下,SIBRE 能够依期望收敛。当原始奖励区分度较弱或稀疏时,重塑后的奖励有助于区分不同的策略。在多个著名的基准环境中使用不同 RL 算法进行的实验表明,SIBRE 能更快、更稳定地收敛到最优策略。我们还进行了关于超参数的敏感性分析,并与基线 RL 算法进行了比较。
引用
@article{arxiv.2004.09846,
title = {SIBRE: Self Improvement Based REwards for Adaptive Feedback in Reinforcement Learning},
author = {Somjit Nath and Richa Verma and Abhik Ray and Harshad Khadilkar},
journal= {arXiv preprint arXiv:2004.09846},
year = {2020}
}
备注
7 pages, 10 figures