用于强化学习高效探索的多模态奖励塑造
机器学习
2021-09-21 v3 人工智能
摘要
保持智能体的长期探索能力仍是深度强化学习的关键挑战之一。一种代表性解决方案是利用奖励塑造为智能体提供内在奖励以鼓励探索。然而,大多数现有方法受困于内在奖励的消失,无法提供可持续的探索激励。此外,它们严重依赖复杂模型和额外记忆来记录学习过程,导致高计算复杂度和低鲁棒性。为解决此问题,提出了基于熵的方法以评估全局探索性能,鼓励智能体更均衡地访问状态空间。然而,在处理高维观测环境时,估计状态访问熵的样本复杂度令人望而却步。在本文中,我们引入了一种称为Jain公平指数(JFI)的新度量来替代熵正则化项,从全新角度解决探索问题。与熵正则化项截然不同,JFI更具可计算性和鲁棒性,并可轻松推广至任意任务。此外,我们利用变分自编码器(VAE)模型捕捉状态的生命周期新颖性,并将其与全局JFI分数结合形成多模态内在奖励。最后,大量仿真结果表明,我们的多模态奖励塑造(MMRS)方法能取得优于其他基准方案的性能。
引用
@article{arxiv.2107.08888,
title = {Multimodal Reward Shaping for Efficient Exploration in Reinforcement Learning},
author = {Mingqi Yuan and Mon-on Pun and Dong Wang and Yi Chen and Haojun Li},
journal= {arXiv preprint arXiv:2107.08888},
year = {2021}
}
备注
17 pages, 5 figures