正则化离策略TD学习
机器学习
2020-06-11 v1 机器学习
摘要
我们提出一种新颖的 正则化离策略收敛TD学习方法(称为RO-TD),能够以低计算复杂度学习价值函数的稀疏表示。RO-TD的算法框架融合了两种关键思想:离策略收敛梯度TD方法(如TDC),以及非光滑凸优化的凸-凹鞍点公式,后者支持一阶求解器与基于在线凸正则化的特征选择。我们对RO-TD进行了详细的理论与实验分析。通过多种实验说明了RO-TD算法的离策略收敛性、稀疏特征选择能力以及低计算成本。
引用
@article{arxiv.2006.05314,
title = {Regularized Off-Policy TD-Learning},
author = {Bo Liu and Sridhar Mahadevan and Ji Liu},
journal= {arXiv preprint arXiv:2006.05314},
year = {2020}
}
备注
26th Advances in Neural Information Processing Systems (NIPS). arXiv admin note: substantial text overlap with arXiv:1405.6757