面向连续状态空间中缓变变量基于模型的强化学习问题的超空间邻域渗透动态规划方法
机器学习
2021-12-07 v1
摘要
连续状态空间中的缓变变量构成了强化学习的一个重要类别,并在许多领域有应用,例如建模温度、湿度等随时间缓慢变化的气候控制系统。然而,近期研究较少涉及该主题。带有某些变体的经典方法,如将状态空间离散化的带瓦片编码(Tile Coding)的动态规划,无法处理缓变变量,因为这些方法无法捕捉每个转移步中的微小变化,且建立极细粒度网格系统在计算上代价高昂或不可能。本文中,我们引入了一种超空间邻域渗透(Hyperspace Neighbor Penetration, HNP)方法来解决该问题。HNP 在每个转移步中捕捉状态在网格化超空间中对相邻超瓦片的部分“渗透”,因此不需要转移是跨瓦片式的也能捕捉变化。因此,HNP 允许使用非常粗糙的网格系统,使计算可行。HNP 假设局部空间中转移函数近似线性,这通常成立。总之,HNP 在处理强化学习中的缓变变量时可比经典方法高效数个数量级。我们已对 NHP 进行了工业部署并取得巨大成功。
引用
@article{arxiv.2106.05497,
title = {Hyperspace Neighbor Penetration Approach to Dynamic Programming for Model-Based Reinforcement Learning Problems with Slowly Changing Variables in A Continuous State Space},
author = {Vincent Zha and Ivey Chiu and Alexandre Guilbault and Jaime Tatis},
journal= {arXiv preprint arXiv:2106.05497},
year = {2021}
}
备注
8 pages, 7 figures