通过拟随机梯度下降的分区参数化策略方法改进山地车问题的泛化能力
机器学习
2021-05-31 v1 人工智能
系统与控制
系统与控制
摘要
本文考虑强化学习问题:寻找使山地车环境中最小时间目标最小化的控制策略。特别地,优化了一类参数化非线性反馈策略,以最小时间到达最高山峰顶端。优化采用拟随机梯度下降(qSGD)方法进行。在试图寻找最优最小时间策略时,考虑了一种新的参数化策略方法,其旨在为状态空间的不同区域学习最优策略参数,而非依赖整个状态空间的单一宏观策略参数。该分区参数化策略方法被证明优于均匀参数化策略方法,并相较先前方法带来更强泛化能力,先前方法中山地车会陷入状态空间中的环形轨迹。
引用
@article{arxiv.2105.13986,
title = {Improving Generalization in Mountain Car Through the Partitioned Parameterized Policy Approach via Quasi-Stochastic Gradient Descent},
author = {Caleb M. Bowyer},
journal= {arXiv preprint arXiv:2105.13986},
year = {2021}
}