中文

具有线性函数逼近与_bandit_反馈的_MDP_中的在线学习

机器学习 2021-06-15 v2 机器学习

摘要

我们考虑一个在线学习问题,其中学习器在一系列回合中与一个马尔可夫决策过程交互,奖励函数允许以对抗方式在回合之间变化,且学习器仅能观测到与其动作相关的奖励。我们允许状态空间任意大,但假设所有动作值函数均可表示为已知低维特征映射的线性函数,并且学习器可访问环境模拟器,能够从真实 MDP 动态中生成轨迹。我们的主要贡献是开发了称为 MDP-LinExp3 的计算高效算法,并证明其 regret 上界为 O~(H2T2/3(dK)1/3)\widetilde{\mathcal{O}}\big(H^2 T^{2/3} (dK)^{1/3}\big),其中 TT 为回合数,HH 为每回合步数,KK 为动作数,dd 为特征映射维度。我们还表明,在远强于 MDP 动态的假设下,regret 可改进至 O~(H2TdK)\widetilde{\mathcal{O}}\big(H^2 \sqrt{TdK}\big)。据我们所知,MDP-LinExp3 是该问题设定下首个可证明高效的算法。

关键词

引用

@article{arxiv.2007.01612,
  title  = {Online learning in MDPs with linear function approximation and bandit feedback},
  author = {Gergely Neu and Julia Olkhovskaya},
  journal= {arXiv preprint arXiv:2007.01612},
  year   = {2021}
}