中文

异步 Q-learning 的样本复杂度:更锐利的分析与方差缩减

机器学习 2022-09-13 v3 信号处理 最优化与控制 统计理论 机器学习 统计理论

摘要

异步 Q-learning 旨在基于行为策略诱导的马尔可夫样本单条轨迹,学习马尔可夫决策过程(MDP)的最优动作值函数(或 Q-函数)。针对具有状态空间 S\mathcal{S} 与动作空间 A\mathcal{A}γ\gamma-折扣 MDP,我们证明,若采用适当的常数学习率,经典异步 Q-learning 的基于 \ell_{\infty} 的样本复杂度——即产生 Q-函数的逐元素 ε\varepsilon-精确估计所需样本数——至多约为 1μmin(1γ)5ε2+tmixμmin(1γ)\frac{1}{\mu_{\min}(1-\gamma)^5\varepsilon^2}+ \frac{t_{mix}}{\mu_{\min}(1-\gamma)}(相差某个对数因子)。此处 tmixt_{mix}μmin\mu_{\min} 分别表示样本轨迹的混合时间与最小状态-动作占用概率。该界的首项与同步情形下从轨迹平稳分布抽取独立样本的样本复杂度一致;第二项反映马尔可夫轨迹经验分布达到稳态所需的代价,发生于初始阶段并在算法运行中逐渐被分摊。令人鼓舞的是,上述界在所有场景下较现有技术 \cite{qu2020finite} 提升至少 SA|\mathcal{S}||\mathcal{A}| 倍,且在任意足够小的精度水平 ε\varepsilon 下提升至少 tmixSAt_{mix}|\mathcal{S}||\mathcal{A}| 倍。进一步,我们证明通过方差缩减可改善关于有效 horizon 11γ\frac{1}{1-\gamma} 的标度。

关键词

引用

@article{arxiv.2006.03041,
  title  = {Sample Complexity of Asynchronous Q-Learning: Sharper Analysis and Variance Reduction},
  author = {Gen Li and Yuting Wei and Yuejie Chi and Yuantao Gu and Yuxin Chen},
  journal= {arXiv preprint arXiv:2006.03041},
  year   = {2022}
}

备注

accepted in part to Neural Information Processing Systems (NeurIPS) 2020