中文

单边反馈/全反馈设置下可证明更高效的 Q-Learning

机器学习 2020-10-06 v2 机器学习

摘要

受经典库存控制问题的情景式版本启发,我们提出了一种基于 Q-learning 的新算法——基于消除的半 Q-Learning(HQL),在单边反馈设置下对各种各样的问题都比现有算法具有更高的效率。我们还提供了该算法的一个更简单的变体,全 Q-Learning(FQL),用于全反馈设置。我们确定 HQL 产生 O~(H3T)\tilde{\mathcal{O}}(H^3\sqrt{ T}) 后悔值,FQL 产生 O~(H2T)\tilde{\mathcal{O}}(H^2\sqrt{ T}) 后悔值,其中 HH 是每幕的长度,TT 是总时间范围的长度。后悔界不受可能巨大的状态和动作空间的影响。我们的数值实验展示了 HQL 和 FQL 的优越效率,以及将强化学习(reinforcement learning)与更丰富的反馈模型相结合的潜力。

关键词

引用

@article{arxiv.2007.00080,
  title  = {Provably More Efficient Q-Learning in the One-Sided-Feedback/Full-Feedback Settings},
  author = {Xiao-Yue Gong and David Simchi-Levi},
  journal= {arXiv preprint arXiv:2007.00080},
  year   = {2020}
}