面向线性混合 MDP 的计算高效无 horizon 强化学习
机器学习
2022-05-24 v1 最优化与控制
机器学习
摘要
近期研究表明,情节式强化学习(RL)并不比上下文_bandit 更难,即便具有长规划 horizon 与未知状态转移。然而,这些结果仅限于表格型马尔可夫决策过程(MDP)或针对线性混合 MDP 的计算低效算法。本文中,我们提出首个计算高效的线性混合 MDP 无 horizon 算法,其达到最优的 遗憾(regret,忽略对数因子)。我们的算法采用一种针对未知转移动态的加权最小二乘估计器,其权重同时是\emph{方差感知}与\emph{不确定性感知}的。当将该加权最小二乘估计器应用于异构线性 bandit 时,我们在前 轮可获得 遗憾,其中 为上下文维度, 为第 轮奖励的方差。在 已知时,这也改进了该设定下已知最优算法。
引用
@article{arxiv.2205.11507,
title = {Computationally Efficient Horizon-Free Reinforcement Learning for Linear Mixture MDPs},
author = {Dongruo Zhou and Quanquan Gu},
journal= {arXiv preprint arXiv:2205.11507},
year = {2022}
}
备注
33 pages, 1 table