基于信息价值的强化学习中探索率的自适应调整
机器学习
2023-01-03 v2 人工智能
信息论
math.IT
摘要
在本文中,我们考虑在使用基于信息价值的探索时调整探索率的问题。为此,我们将信息价值优化转化为寻找随探索率变化的流的平衡点问题。随后我们开发了一种高效的路径跟踪方案以收敛到这些平衡点,从而揭示最优动作选择策略。在该方案下,探索率根据智能体的经验自动调整。理论上保证了全局收敛。我们首先在任天堂 GameBoy 游戏 Centipede 和 Millipede 上评估我们的探索率自适应方法。我们展示了搜索过程的若干方面,例如其产生了状态抽象的层次结构。我们还表明,与依赖启发式、基于退火的调整探索率的传统搜索策略相比,我们的方法以更少的回合返回更优策略。接着我们说明这些趋势适用于深度、基于信息价值的智能体,这些智能体学会游玩十款简单游戏以及任天堂 GameBoy 系统上超过四十款更复杂的游戏。观察到其性能接近或远高于人类游玩水平。
引用
@article{arxiv.2212.11083,
title = {Adapting the Exploration Rate for Value-of-Information-Based Reinforcement Learning},
author = {Isaac J. Sledge and Jose C. Principe},
journal= {arXiv preprint arXiv:2212.11083},
year = {2023}
}
备注
Submitted to the IEEE Transactions on Information Theory