强化学习中与领域无关的乐观初始化
机器学习
2014-10-20 v1 人工智能
摘要
在强化学习 (RL) 中,通常使用价值函数的乐观初始化来鼓励探索。然而,这种方法通常依赖于特定领域,即必须已知奖励的尺度,且特征表示必须具有恒定范数。我们提出了一种简单的方法,该方法在执行乐观初始化时对领域的依赖性较小。
引用
@article{arxiv.1410.4604,
title = {Domain-Independent Optimistic Initialization for Reinforcement Learning},
author = {Marlos C. Machado and Sriram Srinivasan and Michael Bowling},
journal= {arXiv preprint arXiv:1410.4604},
year = {2014}
}