用于强化学习的无监督基函数自适应
人工智能
2017-03-06 v1 机器学习
机器学习
摘要
在使用强化学习(RL)算法评估策略时,鉴于状态空间庞大,引入某种形式的价值函数(VF)近似架构是很常见的。然而,这种架构的确切形式会对 VF 估计的准确性产生重大影响,并且确定合适的近似架构通常是一项高度复杂的任务。因此,人们对允许 RL 算法自适应生成近似架构的潜力抱有极大兴趣。我们研究了一种自适应近似架构的方法,该方法利用关于智能体访问某些状态的频率反馈,来指导对状态空间中哪些区域进行更详细的近似。这种方法是“无监督”的,即它不直接参考奖励或 VF 估计。我们引入了一种基于此思想的算法,该算法在线自适应调整状态聚合近似架构。对 VF 估计进行评分的一种常用方法是,按每个状态-动作发生的概率对其平方 Bellman 误差进行加权。采用这种评分方法,并假设有 个状态,我们在理论上证明了——只要满足 (1) 状态聚合架构中的单元数 达到 量级或更多,(2) 策略和转移函数接近确定性,以及 (3) 转移函数的先验分布为均匀分布——我们的算法与合适的 RL 算法结合使用时,在 变大时可以保证得分任意接近于零。尽管只有 的空间复杂度和可忽略的时间复杂度,它仍能做到这一点。这些结果利用了马尔可夫链平稳分布的某些性质。
引用
@article{arxiv.1703.01026,
title = {Unsupervised Basis Function Adaptation for Reinforcement Learning},
author = {Edward W. Barker and Charl J. Ras},
journal= {arXiv preprint arXiv:1703.01026},
year = {2017}
}
备注
Extended abstract submitted (3 March 2017) for 3rd Multidisciplinary Conference on Reinforcement Learning and Decision Making (RLDM) 2017