中文

关于在具有任意依赖性的反应式环境中学习的可能性

机器学习 2009-12-30 v1 人工智能 信息论 math.IT

摘要

我们探讨了强化学习中的一个问题,其中观测值可能对过去的观测值和动作表现出任意形式的随机依赖性,即比(部分可观测)马尔可夫决策过程更一般的环境。智能体的任务是在真实生成环境未知但属于一个已知的可数环境族时,获得尽可能最佳的渐近奖励。我们找到了环境类上的一些充分条件,在这些条件下,存在一个智能体能够为该类中的任何环境获得最佳渐近奖励。我们分析了这些条件的紧致性,以及它们如何与强化学习及相关领域(如马尔可夫决策过程和混合条件)中已知的不同概率假设相关联。

关键词

引用

@article{arxiv.0810.5636,
  title  = {On the Possibility of Learning in Reactive Environments with Arbitrary Dependence},
  author = {Daniil Ryabko and Marcus Hutter},
  journal= {arXiv preprint arXiv:0810.5636},
  year   = {2009}
}

备注

20 pages