中文

线性混合MDP的最优无视野无关奖励自由探索

机器学习 2024-02-15 v2 最优化与控制 机器学习

摘要

我们研究带线性函数近似的奖励自由强化学习(reinforcement learning, RL),其中智能体分两阶段工作:(1)在探索阶段,智能体与环境交互但无法获取奖励;(2)在规划阶段,给定奖励函数,智能体基于探索阶段收集的样本寻找近最优策略。现有奖励自由算法的样本复杂度对规划视野(planning horizon)具有多项式依赖,使其在长规划视野RL问题中难以处理。本文提出一种用于学习线性混合马尔可夫决策过程(Markov decision processes, MDPs)的新奖励自由算法,其转移概率可参数化为已知特征映射的线性组合。我们算法的核心是带探索驱动伪奖励的不确定性加权价值目标回归,以及用于偶然与认知不确定性的高阶矩估计器。当总奖励以11为界时,我们证明算法仅需探索O~(d2ε2)\tilde O(d^2\varepsilon^{-2})轮即可找到ε\varepsilon-最优策略,其中dd为特征映射维度。算法的样本复杂度仅对规划视野具有多对数依赖,因此为“无视野无关(horizon-free)”。此外,我们给出了Ω(d2ε2)\Omega(d^2\varepsilon^{-2})的样本复杂度下界,其与算法样本复杂度仅相差对数因子,表明算法最优。

关键词

引用

@article{arxiv.2303.10165,
  title  = {Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs},
  author = {Junkai Zhang and Weitong Zhang and Quanquan Gu},
  journal= {arXiv preprint arXiv:2303.10165},
  year   = {2024}
}

备注

37 pages, 1 figure, 2 tables. In ICML 2023