基于价值条件状态熵探索的强化学习加速方法
机器学习
2024-08-12 v3 人工智能
摘要
一种有前景的探索技术是最大化已访问状态分布(即状态熵)的熵,通过鼓励对已访问状态空间的均匀覆盖来实现。尽管该方法在无监督设定中有效,但在带有任务奖励的监督设定中往往表现不佳,因为智能体倾向于访问高价值状态以利用任务奖励。这种偏好会导致高价值状态与低价值状态分布之间的不平衡,而当分布变得更均匀时状态熵增加,从而使探索偏向低价值状态区域。当高价值状态在状态空间中分布狭窄时,该问题会加剧,使智能体难以完成任务。本文提出一种新颖的探索技术,最大化价值条件状态熵,即分别估计以各状态价值估计为条件的状态熵,然后最大化其平均值。通过仅考虑具有相似价值估计的已访问状态来计算内在奖励,我们的方法防止低价值状态分布影响高价值状态周围的探索,反之亦然。我们证明,所提出的替代状态熵基线的方法在 MiniGrid、DeepMind Control Suite 和 Meta-World 基准的多种任务中显著加速了各类强化学习算法。源代码见 https://sites.google.com/view/rl-vcse。
引用
@article{arxiv.2305.19476,
title = {Accelerating Reinforcement Learning with Value-Conditional State Entropy Exploration},
author = {Dongyoung Kim and Jinwoo Shin and Pieter Abbeel and Younggyo Seo},
journal= {arXiv preprint arXiv:2305.19476},
year = {2024}
}
备注
NeurIPS 2024. Project webpage: https://sites.google.com/view/rl-vcse