中文

论值函数与智能体-环境边界

机器学习 2020-06-02 v3 人工智能 机器学习

摘要

当在强化学习(RL)中部署函数逼近时,同一问题可能以不同方式表述,通常是将一个预处理步骤视为环境的一部分或智能体的一部分。因此,RL中的基本概念,如(最优)值函数,并非唯一确定,因为它们依赖于我们如何划定该智能体-环境边界,这给提供最优性保证的理论分析带来了问题。我们通过一种简单而新颖的边界不变分析来解决此问题,以具有代表性的RL算法 Fitted Q-Iteration 为例,其假设与保证不随边界选择而改变。我们还讨论了与状态重置和蒙特卡洛树搜索、确定性与随机系统、模仿学习以及理论假设从数据中的可验证性密切相关的相关问题。

关键词

引用

@article{arxiv.1905.13341,
  title  = {On Value Functions and the Agent-Environment Boundary},
  author = {Nan Jiang},
  journal= {arXiv preprint arXiv:1905.13341},
  year   = {2020}
}

备注

16 pages