具有串行马尔可夫链推理的策略梯度
机器学习
2022-10-14 v1 人工智能
摘要
我们引入了一个新的框架,将强化学习(RL)中的决策建模为一个迭代推理过程。我们将智能体行为建模为参数化推理马尔可夫链(RMC)的稳态分布,并使用一种新的策略梯度可处理估计进行优化。我们通过模拟RMC足够多的推理步数以接近其稳态分布来执行动作选择。我们展示了我们的框架具有传统RL固有缺失的若干有用性质。例如,它通过用简单的高斯转移函数参数化RMC,允许智能体行为逼近任意连续的动作分布。此外,达到收敛所需的推理步数可随每个动作选择决策的难度自适应地扩展,并可通过重用过去的解决方案来加速。我们所得的算法在流行的Mujoco和DeepMind Control基准测试中取得了最先进的性能,包括本体感知和基于像素的任务。
引用
@article{arxiv.2210.06766,
title = {Policy Gradient With Serial Markov Chain Reasoning},
author = {Edoardo Cetin and Oya Celiktutan},
journal= {arXiv preprint arXiv:2210.06766},
year = {2022}
}
备注
NeurIPS 2022