具有不确定回合长度的在线强化学习
机器学习
2023-02-08 v1
摘要
现有的回合制强化学习算法假设回合长度随时间固定且先验已知。本文考虑一种通用的回合制强化学习框架,其中每个回合的长度从某一分布中抽取。我们首先确立该问题等价于具有一般折扣的在线强化学习,其中学习者试图优化无限 horizon 上的期望折扣累积奖励,但折扣函数未必为几何形式。我们表明,以该新的一般折扣最小化遗憾等价于以不确定回合长度最小化遗憾。随后我们设计了一种以一般折扣最小化遗憾但面向不确定回合长度设定的强化学习算法。我们将一般界实例化为不同类型的折扣,包括几何折扣与多项式折扣。我们还表明,即使回合长度的不确定性未知,也可通过随时间估计未知分布获得类似的遗憾界。最后,我们在网格世界环境中将我们的学习算法与现有的基于值迭代的回合制RL算法进行比较。
引用
@article{arxiv.2302.03608,
title = {Online Reinforcement Learning with Uncertain Episode Lengths},
author = {Debmalya Mandal and Goran Radanovic and Jiarui Gan and Adish Singla and Rupak Majumdar},
journal= {arXiv preprint arXiv:2302.03608},
year = {2023}
}
备注
To appear at AAAI-2023