论值函数与智能体-环境边界
机器学习
2020-06-02 v3 人工智能
机器学习
摘要
当在强化学习(RL)中部署函数逼近时,同一问题可能以不同方式表述,通常是将一个预处理步骤视为环境的一部分或智能体的一部分。因此,RL中的基本概念,如(最优)值函数,并非唯一确定,因为它们依赖于我们如何划定该智能体-环境边界,这给提供最优性保证的理论分析带来了问题。我们通过一种简单而新颖的边界不变分析来解决此问题,以具有代表性的RL算法 Fitted Q-Iteration 为例,其假设与保证不随边界选择而改变。我们还讨论了与状态重置和蒙特卡洛树搜索、确定性与随机系统、模仿学习以及理论假设从数据中的可验证性密切相关的相关问题。
引用
@article{arxiv.1905.13341,
title = {On Value Functions and the Agent-Environment Boundary},
author = {Nan Jiang},
journal= {arXiv preprint arXiv:1905.13341},
year = {2020}
}
备注
16 pages