将 TD 误差作为 Q($\sigma$, $\lambda$) 中 $\sigma$ 选择的启发式方法探究
机器学习
2019-12-24 v1 机器学习
摘要
在 TD 算法的版图中,Q(, ) 算法是一种能够以在线方式执行多步备份,同时成功统一针对状态的所有动作使用采样与期望概念的方法。 表示使用采样的程度。选择 的值可基于当前状态的特征,而非采用常数值或基于时间。本报告探究了此类基于 TD 误差方案的可行性。
引用
@article{arxiv.1912.10316,
title = {Exploring TD error as a heuristic for $\sigma$ selection in Q($\sigma$, $\lambda$)},
author = {Abhishek Nan},
journal= {arXiv preprint arXiv:1912.10316},
year = {2019}
}