中文

正则化离策略TD学习

机器学习 2020-06-11 v1 机器学习

摘要

我们提出一种新颖的 l1l_1 正则化离策略收敛TD学习方法(称为RO-TD),能够以低计算复杂度学习价值函数的稀疏表示。RO-TD的算法框架融合了两种关键思想:离策略收敛梯度TD方法(如TDC),以及非光滑凸优化的凸-凹鞍点公式,后者支持一阶求解器与基于在线凸正则化的特征选择。我们对RO-TD进行了详细的理论与实验分析。通过多种实验说明了RO-TD算法的离策略收敛性、稀疏特征选择能力以及低计算成本。

关键词

引用

@article{arxiv.2006.05314,
  title  = {Regularized Off-Policy TD-Learning},
  author = {Bo Liu and Sridhar Mahadevan and Ji Liu},
  journal= {arXiv preprint arXiv:2006.05314},
  year   = {2020}
}

备注

26th Advances in Neural Information Processing Systems (NIPS). arXiv admin note: substantial text overlap with arXiv:1405.6757