中文

强化学习中与领域无关的乐观初始化

机器学习 2014-10-20 v1 人工智能

摘要

在强化学习 (RL) 中,通常使用价值函数的乐观初始化来鼓励探索。然而,这种方法通常依赖于特定领域,即必须已知奖励的尺度,且特征表示必须具有恒定范数。我们提出了一种简单的方法,该方法在执行乐观初始化时对领域的依赖性较小。

关键词

引用

@article{arxiv.1410.4604,
  title  = {Domain-Independent Optimistic Initialization for Reinforcement Learning},
  author = {Marlos C. Machado and Sriram Srinivasan and Michael Bowling},
  journal= {arXiv preprint arXiv:1410.4604},
  year   = {2014}
}