前瞻有界 Q-learning
机器学习
2020-06-30 v1 最优化与控制
机器学习
摘要
我们引入了前瞻有界 Q-learning(LBQL)算法,这是一种新的、可证明收敛的 Q-learning 变体,它通过使用“前瞻”上下界来寻求改善标准 Q-learning 在随机环境中的性能。为此,LBQL 利用先前收集的经验以及每次迭代的状态-动作值作为对偶可行罚函数,构造一系列抽样信息松弛问题。这些问题的解提供了最优值的估计上下界,我们通过随机近似对其进行跟踪。然后这些量被用来约束迭代在每次迭代中保持在界内。在基准问题上的数值实验表明,与标准 Q-learning 和几种相关技术相比,LBQL 表现出更快的收敛性以及对超参数更强的鲁棒性。我们的方法在需要昂贵仿真或真实世界交互的问题中尤其具有吸引力。
引用
@article{arxiv.2006.15690,
title = {Lookahead-Bounded Q-Learning},
author = {Ibrahim El Shar and Daniel R. Jiang},
journal= {arXiv preprint arXiv:2006.15690},
year = {2020}
}
备注
To appear in proceedings of the 37th International Conference on Machine Learning