通过学习外部价值函数对元梯度强化学习去偏
机器学习
2022-11-22 v1 人工智能
摘要
元梯度强化学习(RL)允许智能体在训练过程中以在线方式自我调节其超参数。在本文中,我们指出了当前元梯度 RL 方法中的元梯度偏差。该偏差源于在外层目标中使用由元学习折扣因子训练得到的评论家(critic)进行优势估计,而外层目标需要不同的折扣因子。由于元学习折扣因子通常低于外层目标中使用的折扣因子,由此产生的偏差可能导致元梯度偏向短视策略。我们针对此问题提出了一个简单的解决方案:我们在外部损失估计中使用一个替代的、\emph{外部}价值函数来消除该偏差。为获得此外部价值函数,我们给评论家网络增加了第二个头,并使用外层损失折扣因子与经典评论家一同训练它。在一个说明性的玩具问题上,我们展示了该偏差会导致当前元梯度 RL 方法的灾难性失败,并表明我们提出的解决方案可修复该问题。随后我们将方法应用于更复杂的环境,并证明修复元梯度偏差能显著提升性能。
引用
@article{arxiv.2211.10550,
title = {Debiasing Meta-Gradient Reinforcement Learning by Learning the Outer Value Function},
author = {Clément Bonnet and Laurence Midgley and Alexandre Laterre},
journal= {arXiv preprint arXiv:2211.10550},
year = {2022}
}
备注
Published at the 6th Workshop on Meta-Learning at NeurIPS 2022, New Orleans