中文

面向线性混合 MDP 的计算高效无 horizon 强化学习

机器学习 2022-05-24 v1 最优化与控制 机器学习

摘要

近期研究表明,情节式强化学习(RL)并不比上下文_bandit 更难,即便具有长规划 horizon 与未知状态转移。然而,这些结果仅限于表格型马尔可夫决策过程(MDP)或针对线性混合 MDP 的计算低效算法。本文中,我们提出首个计算高效的线性混合 MDP 无 horizon 算法,其达到最优的 O~(dK+d2)\tilde O(d\sqrt{K} +d^2) 遗憾(regret,忽略对数因子)。我们的算法采用一种针对未知转移动态的加权最小二乘估计器,其权重同时是\emph{方差感知}与\emph{不确定性感知}的。当将该加权最小二乘估计器应用于异构线性 bandit 时,我们在前 KK 轮可获得 O~(dk=1Kσk2+d)\tilde O(d\sqrt{\sum_{k=1}^K \sigma_k^2} +d) 遗憾,其中 dd 为上下文维度,σk2\sigma_k^2 为第 kk 轮奖励的方差。在 σk2\sigma_k^2 已知时,这也改进了该设定下已知最优算法。

关键词

引用

@article{arxiv.2205.11507,
  title  = {Computationally Efficient Horizon-Free Reinforcement Learning for Linear Mixture MDPs},
  author = {Dongruo Zhou and Quanquan Gu},
  journal= {arXiv preprint arXiv:2205.11507},
  year   = {2022}
}

备注

33 pages, 1 table