Logistic Q学习
机器学习
2021-03-01 v2 人工智能
机器学习
摘要
我们提出了一种新的强化学习算法,该算法源自马尔可夫决策过程(MDP)中最优控制的正则化线性规划公式。该方法与Peters等人(2010)的经典相对熵策略搜索(REPS)算法密切相关,关键区别在于我们的方法引入了Q函数,从而实现高效精确的免模型实现。我们的算法(称为QREPS)的主要特征是一个用于策略评估的凸损失函数,它作为广泛使用的平方Bellman误差在理论上的可靠替代。我们提供了一种用于最小化该损失函数的实用鞍点优化方法,并提供了误差传播分析,将单次更新的质量与输出策略的性能联系起来。最后,我们在一系列基准问题上展示了我们方法的有效性。
引用
@article{arxiv.2010.11151,
title = {Logistic Q-Learning},
author = {Joan Bas-Serrano and Sebastian Curi and Andreas Krause and Gergely Neu},
journal= {arXiv preprint arXiv:2010.11151},
year = {2021}
}