内部奖励强化学习
机器学习
2023-08-28 v3 人工智能
摘要
我们研究一类强化学习问题,其中用于策略学习的奖励信号由一个内部奖励模型生成,该模型依赖于策略并与之联合优化。策略与奖励模型之间的相互依赖导致学习过程不稳定,因为来自不成熟奖励模型的奖励信号含有噪声并阻碍策略学习,反之,未充分优化的策略也阻碍奖励估计学习。我们将此学习设定称为 (IRRL),因为奖励并非由环境直接提供,而是由奖励模型 提供。本文中,我们形式化地表述 IRRL 并给出属于 IRRL 的一类问题。我们从理论上推导并实证分析了 IRRL 中奖励函数的影响,并基于这些分析提出了截断线性奖励函数。实验结果表明,所提出的奖励函数能够通过降低奖励噪声的影响持续稳定训练过程,从而在多样任务中相比基线实现更快收敛与更高性能。
引用
@article{arxiv.2302.00270,
title = {Internally Rewarded Reinforcement Learning},
author = {Mengdi Li and Xufeng Zhao and Jae Hee Lee and Cornelius Weber and Stefan Wermter},
journal= {arXiv preprint arXiv:2302.00270},
year = {2023}
}
备注
Accepted at ICML 2023. Update: adopt the term "reward model" instead of using "critic" to prevent confusion with the term "critic" in actor-critic algorithms. Project webpage at https://ir-rl.github.io