面向元强化学习的具有剧烈方差缩减的偏梯度估计
机器学习
2021-12-15 v1
摘要
尽管元强化学习(meta-RL)在经验上取得成功,理论与实践之间仍存在诸多理解不足的偏差。关键的是,实践中几乎总是采用偏梯度估计,而先前关于元强化学习的理论仅在无偏梯度估计下建立收敛性。本文研究了这一偏差。具体而言:(1)我们证明无偏梯度估计的方差为,线性依赖于内循环更新的样本量;(2)我们提出线性化得分函数(LSF)梯度估计,其偏差为、方差为;(3)我们表明大多数先前的实证工作实际上实现了LSF梯度估计的变体,这意味着实际算法“偶然”引入偏差以取得更好性能;(4)我们针对LSF梯度估计在元强化学习中收敛至驻点建立了理论保证,当较大时显示出优于先前工作的对的依赖性。
引用
@article{arxiv.2112.07328,
title = {Biased Gradient Estimate with Drastic Variance Reduction for Meta Reinforcement Learning},
author = {Yunhao Tang},
journal= {arXiv preprint arXiv:2112.07328},
year = {2021}
}