中文

强化学习中带偏置的聚合、展开与增强策略改进

机器学习 2019-10-08 v1 人工智能

摘要

我们提出一种新的用于近似动态规划的聚合框架, 它提供了与展开算法、近似策略迭代以及其他单步和多步前瞻方法的联系。其核心新颖特征在于使用状态的偏置函数 VV, 该函数将聚合代价函数的值偏置至其正确水平。当 V0V\equiv0 时得到经典聚合框架, 但我们的方案在 VV 为已知相当好的最优代价函数 JJ^* 的近似时效果最佳。当 VV 等于某已知策略 μ\mu 的代价函数 JμJ_{\mu} 且只有一个聚合状态时, 我们的方案等价于基于 μ\mu 的展开算法 (即, 从策略 μ\mu 开始单次策略改进的结果)。当 V=JμV=J_{\mu} 且有多个聚合状态时, 我们的聚合方法可用作 μ\mu 的一种更强大的改进形式。因此, 当与近似策略评估方案结合时, 我们的方法可构成一种新颖且增强的近似策略迭代的基础。当 VV 为一般偏置函数时, 我们的方案等价于值空间近似, 其前瞻函数等于 VV 加上每个聚合状态内的局部修正。局部修正水平通过求解一个低维聚合 DP 问题获得, 当聚合状态数量足够大时, 可得到对任意接近 JJ^* 的近似。除偏置函数外, 聚合 DP 问题与经典聚合框架中的问题相似, 并且其通过仿真或其他方法的算法求解与经典聚合几乎相同, 假设在需要时 VV 的值可得。

关键词

引用

@article{arxiv.1910.02426,
  title  = {Biased Aggregation, Rollout, and Enhanced Policy Improvement for Reinforcement Learning},
  author = {Dimitri Bertsekas},
  journal= {arXiv preprint arXiv:1910.02426},
  year   = {2019}
}