分层基于模型的策略优化:从动作到动作序列再返回
机器学习
2020-01-03 v2 人工智能
最优化与控制
机器学习
摘要
我们基于在所有可能状态-动作路径空间上应用二阶方法,发展了一个分层基于模型的策略优化的规范框架。所得的自然路径梯度以对诱导平稳状态-动作密度的长程关联结构敏感的方式执行策略更新。我们证明,给定环境动力学模型,自然路径梯度可被精确计算,并依赖于类似于高阶后继表示的表达式。在仿真中,我们表明所得策略流中局部策略更新的优先级确实在数个玩具问题中反映了直观的状态空间分层。
关键词
引用
@article{arxiv.1912.01448,
title = {Hierarchical model-based policy optimization: from actions to action sequences and back},
author = {Daniel McNamee},
journal= {arXiv preprint arXiv:1912.01448},
year = {2020}
}
备注
NeurIPS 2019 Optimization Foundations of Reinforcement Learning Workshop. v2: typos fixed, minor edits for improved clarity