中文

基于上下文的上置信界用于有向探索

机器学习 2021-04-07 v2 人工智能

摘要

强化学习中的有向探索策略对于以最少的环境交互次数学习最优策略至关重要。许多算法通过访问次数估计或上置信界使用乐观主义来引导探索,而非像 \epsilon-greedy 那样使用随机的、无向的探索等数据低效策略。大多数数据高效的探索方法需要大量计算,通常依赖学习到的模型来引导探索。最小二乘方法有可能提供基于模型方法的一些数据高效益处——因为它们总结了过去的交互——其计算量接近于无模型方法。在这项工作中,我们利用最小二乘时序差分学习(LSTD)的这一特性,提供了一种新颖的、计算高效的自增量探索策略。我们推导了 LSTD 所学动作值上的上置信界,具有上下文相关(或状态相关)的噪声方差。这种上下文相关的噪声将探索集中在可变状态的一个子集上,并允许在其他状态中减少探索。我们通过实验证明,我们的算法比使用动作值置信估计的其他自增量探索策略收敛得更快。

关键词

引用

@article{arxiv.1811.06629,
  title  = {Context-Dependent Upper-Confidence Bounds for Directed Exploration},
  author = {Raksha Kumaraswamy and Matthew Schlegel and Adam White and Martha White},
  journal= {arXiv preprint arXiv:1811.06629},
  year   = {2021}
}

备注

Neural Information Processing Systems 2018