中文

将 TD 误差作为 Q($\sigma$, $\lambda$) 中 $\sigma$ 选择的启发式方法探究

机器学习 2019-12-24 v1 机器学习

摘要

在 TD 算法的版图中,Q(σ\sigma, λ\lambda) 算法是一种能够以在线方式执行多步备份,同时成功统一针对状态的所有动作使用采样与期望概念的方法。σ[0,1]\sigma \in [0, 1] 表示使用采样的程度。选择 σ\sigma 的值可基于当前状态的特征,而非采用常数值或基于时间。本报告探究了此类基于 TD 误差方案的可行性。

关键词

引用

@article{arxiv.1912.10316,
  title  = {Exploring TD error as a heuristic for $\sigma$ selection in Q($\sigma$, $\lambda$)},
  author = {Abhishek Nan},
  journal= {arXiv preprint arXiv:1912.10316},
  year   = {2019}
}