单边反馈/全反馈设置下可证明更高效的 Q-Learning
机器学习
2020-10-06 v2 机器学习
摘要
受经典库存控制问题的情景式版本启发,我们提出了一种基于 Q-learning 的新算法——基于消除的半 Q-Learning(HQL),在单边反馈设置下对各种各样的问题都比现有算法具有更高的效率。我们还提供了该算法的一个更简单的变体,全 Q-Learning(FQL),用于全反馈设置。我们确定 HQL 产生 后悔值,FQL 产生 后悔值,其中 是每幕的长度, 是总时间范围的长度。后悔界不受可能巨大的状态和动作空间的影响。我们的数值实验展示了 HQL 和 FQL 的优越效率,以及将强化学习(reinforcement learning)与更丰富的反馈模型相结合的潜力。
引用
@article{arxiv.2007.00080,
title = {Provably More Efficient Q-Learning in the One-Sided-Feedback/Full-Feedback Settings},
author = {Xiao-Yue Gong and David Simchi-Levi},
journal= {arXiv preprint arXiv:2007.00080},
year = {2020}
}