具有线性函数逼近与_bandit_反馈的_MDP_中的在线学习
机器学习
2021-06-15 v2 机器学习
摘要
我们考虑一个在线学习问题,其中学习器在一系列回合中与一个马尔可夫决策过程交互,奖励函数允许以对抗方式在回合之间变化,且学习器仅能观测到与其动作相关的奖励。我们允许状态空间任意大,但假设所有动作值函数均可表示为已知低维特征映射的线性函数,并且学习器可访问环境模拟器,能够从真实 MDP 动态中生成轨迹。我们的主要贡献是开发了称为 MDP-LinExp3 的计算高效算法,并证明其 regret 上界为 ,其中 为回合数, 为每回合步数, 为动作数, 为特征映射维度。我们还表明,在远强于 MDP 动态的假设下,regret 可改进至 。据我们所知,MDP-LinExp3 是该问题设定下首个可证明高效的算法。
引用
@article{arxiv.2007.01612,
title = {Online learning in MDPs with linear function approximation and bandit feedback},
author = {Gergely Neu and Julia Olkhovskaya},
journal= {arXiv preprint arXiv:2007.01612},
year = {2021}
}