分层平均奖励策略梯度算法
机器学习
2019-11-21 v1 人工智能
摘要
选项批评学习(option-critic learning)是一种通用的强化学习(RL)框架,旨在通过利用时间抽象来解决长期信用分配问题。然而,在处理扩展时间尺度时,对未来奖励进行折扣可能导致错误的信用分配。在这项工作中,我们通过扩展用于平均奖励准则的分层选项批评策略梯度定理来解决此问题。我们提出的框架旨在最大化由智能体策略定义的马尔可夫链稳态下获得的长期奖励。此外,我们使用基于常微分方程的方法进行收敛分析,并证明选项内策略、终止函数和值函数的参数以概率一收敛到其相应的最优值。最后,我们在具有稀疏奖励的网格世界环境中展示了在平均奖励设定下学习选项的竞争优势。
引用
@article{arxiv.1911.08826,
title = {Hierarchical Average Reward Policy Gradient Algorithms},
author = {Akshay Dharmavaram and Matthew Riemer and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:1911.08826},
year = {2019}
}
备注
6 pages, 3 figures, to be published in Proceedings of the Thirty-Fourth AAAI Conference on Artificial Intelligence