在线学习环境下一种收敛的离策略时序差分学习算法
机器学习
2016-05-20 v1
摘要
本文中,我们针对“在线”学习环境下一种具有线性函数逼近且每时间步线性计算复杂度的“离策略”时序差分学习算法,提供了严格的收敛性分析。此处考虑的算法是由Maei等人引入的带重要性加权的TDC。我们通过给出针对标准离策略反例的合适实证结果来支持我们的理论结果。
引用
@article{arxiv.1605.06076,
title = {On a convergent off -policy temporal difference learning algorithm in on-line learning environment},
author = {Prasenjit Karmakar and Rajkumar Maity and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:1605.06076},
year = {2016}
}
备注
14 pages. arXiv admin note: text overlap with arXiv:1503.09105