基于线性奖励塑形的乐观好奇探索与保守利用
机器学习
2022-10-18 v2 人工智能
摘要
在本工作中,我们研究基于价值的深度强化学习(DRL)中简单但普遍适用的奖励塑形情形。我们表明以线性变换形式的奖励偏移等价于在函数近似中改变 -函数的初始化。基于此种等价性,我们带来关键洞见:正奖励偏移导致保守利用,而负奖励偏移导致好奇驱动探索。相应地,保守利用改善离线RL价值估计,而乐观价值估计改善在线RL的探索。我们在一系列RL任务上验证我们的洞见并展示其相对于基线的改进:(1)在离线RL中,保守利用基于现成算法带来性能提升;(2)在在线连续控制中,具有不同偏移常数的多个价值函数可用于解决探索-利用困境以获得更好样本效率;(3)在离散控制任务中,负奖励偏移相较基于好奇的探索方法带来改进。
引用
@article{arxiv.2209.07288,
title = {Optimistic Curiosity Exploration and Conservative Exploitation with Linear Reward Shaping},
author = {Hao Sun and Lei Han and Rui Yang and Xiaoteng Ma and Jian Guo and Bolei Zhou},
journal= {arXiv preprint arXiv:2209.07288},
year = {2022}
}