基于网格的低分形维数强化学习策略分析
机器人学
2021-10-01 v3
摘要
在先前工作中,通过我们称为网格化(meshing)的过程,各种连续与混合系统的可达状态空间被近似为一组离散状态,进而可综合为马尔可夫链。该方法的一个应用是分析通过强化学习获得的运动策略,以逐步对所得系统的稳定性性质做出经验性保证。在另一研究线索中,我们为策略内(on-policy)强化学习算法引入了一种利用 rollout 轨迹“分形维数”的修正奖励函数。该奖励被证明能鼓励产生这样的策略:其诱导的单个轨迹可更紧凑地表示为离散网格。本工作中,我们将这两条研究线索结合,对受扰动且由修正奖励所得策略控制的系统的可达状态空间构建网格。我们的分析表明,修正后的策略确实产生小得多的可达网格。这表明,以分形维数奖励训练的智能体将其具有更紧凑状态空间的可取性质迁移到了具有外部扰动的设定中。结果还暗示,先前使用基于网格的工具分析 RL 策略的工作可扩展到更高维系统或比原本可能达到的更高分辨率网格。
引用
@article{arxiv.2012.13032,
title = {Mesh Based Analysis of Low Fractal Dimension Reinforcement Learning Policies},
author = {Sean Gillen and Katie Byl},
journal= {arXiv preprint arXiv:2012.13032},
year = {2021}
}
备注
ICRA 2021