中文

减少梯度评估次数的策略评估SVRG方法

机器学习 2020-06-22 v2 机器学习

摘要

随机方差缩减梯度(SVRG)是一种最初为处理具有有限和结构的机器学习问题而设计的优化方法。后来SVRG被证明可用于策略评估,即强化学习中对给定策略的值函数进行估计的问题。SVRG利用两种尺度的梯度估计。在较慢尺度上,SVRG计算整个数据集上的完整梯度,这可能导致高昂的计算成本。本工作中,我们展示两种用于策略评估的SVRG变体能够在保持线性收敛速度的同时显著减少梯度计算次数。更重要的是,我们的理论结果表明,当SVRG应用于带线性函数近似的策略评估时,无需在每个轮次中使用整个数据集。我们的实验证明了所提方法带来的巨大计算节省。

关键词

引用

@article{arxiv.1906.03704,
  title  = {SVRG for Policy Evaluation with Fewer Gradient Evaluations},
  author = {Zilun Peng and Ahmed Touati and Pascal Vincent and Doina Precup},
  journal= {arXiv preprint arXiv:1906.03704},
  year   = {2020}
}

备注

Short version of the paper is published in the proceedings of the 29th International Joint Conference on Artificial Intelligence and the 17th Pacific Rim International Conference on Artificial Intelligence (IJCAI-PRICAI2020)