中文

具有最优 n 的 n 步时序差分学习

机器学习 2024-07-18 v5

摘要

我们考虑在 n 步时序差分(TD)学习算法中寻找最优 n 值的问题。该优化问题的目标函数为平均均方根误差(RMSE)。我们通过一种无模型优化技术求得最优 n,该技术采用基于一次仿真的同步扰动随机逼近(SPSA)流程。由于 SPSA 是一种零阶连续优化方法,我们利用随机投影算子将其适配到离散优化设定中。我们通过证明使用零阶随机梯度搜索得到的 n 更新序列几乎必然收敛至关联微分包含的一个内部链传递不变集,从而证明了递归的渐近收敛性。这导致离散参数序列收敛至 n 步 TD 中的最优 n。通过实验,我们表明利用我们的 SDPSA 算法,对于任意初值均可达到最优 n 值。我们进一步通过数值评估表明,在基准强化学习任务上 SDPSA 优于最先进的离散参数随机优化算法最优计算预算分配(OCBA)。

关键词

引用

@article{arxiv.2303.07068,
  title  = {n-Step Temporal Difference Learning with Optimal n},
  author = {Lakshmi Mandal and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:2303.07068},
  year   = {2024}
}