中文

悲观主义在异步 Q-learning 中的有效性

机器学习 2022-03-15 v1 信息论 math.IT 最优化与控制 统计理论 机器学习 统计理论

摘要

本文关注 Q-learning 的异步形式,其将随机逼近方案应用于马尔可夫数据样本。受离线强化学习近期进展的启发,我们开发了一个将悲观主义原则引入异步 Q-learning 的算法框架,该框架基于合适的下置信界(LCB)对不常访问的状态-动作对进行惩罚。除其他外,该框架在存在近专家数据的情况下带来了改进的样本效率和增强的自适应性。我们的方法允许某些重要场景中的观测数据仅覆盖部分状态-动作空间,这与先前要求所有状态-动作对均匀覆盖的理论形成鲜明对比。当与方差缩减思想结合时,带 LCB 惩罚的异步 Q-learning 在目标精度足够小时实现了近最优样本复杂度。相比之下,即便允许 i.i.d. 采样,先前工作在关于有效视界的依赖上也是次优的。我们的结果为在马尔可夫非 i.i.d. 数据存在下使用悲观主义原则提供了首个理论支持。

关键词

引用

@article{arxiv.2203.07368,
  title  = {The Efficacy of Pessimism in Asynchronous Q-Learning},
  author = {Yuling Yan and Gen Li and Yuxin Chen and Jianqing Fan},
  journal= {arXiv preprint arXiv:2203.07368},
  year   = {2022}
}