强化学习中带偏置的聚合、展开与增强策略改进
机器学习
2019-10-08 v1 人工智能
摘要
我们提出一种新的用于近似动态规划的聚合框架, 它提供了与展开算法、近似策略迭代以及其他单步和多步前瞻方法的联系。其核心新颖特征在于使用状态的偏置函数 , 该函数将聚合代价函数的值偏置至其正确水平。当 时得到经典聚合框架, 但我们的方案在 为已知相当好的最优代价函数 的近似时效果最佳。当 等于某已知策略 的代价函数 且只有一个聚合状态时, 我们的方案等价于基于 的展开算法 (即, 从策略 开始单次策略改进的结果)。当 且有多个聚合状态时, 我们的聚合方法可用作 的一种更强大的改进形式。因此, 当与近似策略评估方案结合时, 我们的方法可构成一种新颖且增强的近似策略迭代的基础。当 为一般偏置函数时, 我们的方案等价于值空间近似, 其前瞻函数等于 加上每个聚合状态内的局部修正。局部修正水平通过求解一个低维聚合 DP 问题获得, 当聚合状态数量足够大时, 可得到对任意接近 的近似。除偏置函数外, 聚合 DP 问题与经典聚合框架中的问题相似, 并且其通过仿真或其他方法的算法求解与经典聚合几乎相同, 假设在需要时 的值可得。
引用
@article{arxiv.1910.02426,
title = {Biased Aggregation, Rollout, and Enhanced Policy Improvement for Reinforcement Learning},
author = {Dimitri Bertsekas},
journal= {arXiv preprint arXiv:1910.02426},
year = {2019}
}