重访矩阵形式的策略优化
机器学习
2019-09-23 v1 人工智能
摘要
在表格型情况下,当奖励和环境动态已知时,策略评估可写为 ,其中 是给定策略 下的状态转移矩阵, 是给定 下的奖励信号。困扰我们的是, 和 都与 混合在一起,这意味着每次更新 时,它们都会一起改变。本文中,我们利用文献 \cite{wang2007dual} 中的记号来解耦 与环境动态,使得对策略的优化更为直接。我们证明,策略梯度定理 \cite{sutton2018reinforcement} 和 TRPO \cite{schulman2015trust} 可被纳入一个更一般的框架,且这种记号具有良好的潜力,可扩展到基于模型的强化学习。
引用
@article{arxiv.1909.09186,
title = {Revisit Policy Optimization in Matrix Form},
author = {Sitao Luan and Xiao-Wen Chang and Doina Precup},
journal= {arXiv preprint arXiv:1909.09186},
year = {2019}
}