线性混合MDP的最优无视野无关奖励自由探索
机器学习
2024-02-15 v2 最优化与控制
机器学习
摘要
我们研究带线性函数近似的奖励自由强化学习(reinforcement learning, RL),其中智能体分两阶段工作:(1)在探索阶段,智能体与环境交互但无法获取奖励;(2)在规划阶段,给定奖励函数,智能体基于探索阶段收集的样本寻找近最优策略。现有奖励自由算法的样本复杂度对规划视野(planning horizon)具有多项式依赖,使其在长规划视野RL问题中难以处理。本文提出一种用于学习线性混合马尔可夫决策过程(Markov decision processes, MDPs)的新奖励自由算法,其转移概率可参数化为已知特征映射的线性组合。我们算法的核心是带探索驱动伪奖励的不确定性加权价值目标回归,以及用于偶然与认知不确定性的高阶矩估计器。当总奖励以为界时,我们证明算法仅需探索轮即可找到-最优策略,其中为特征映射维度。算法的样本复杂度仅对规划视野具有多对数依赖,因此为“无视野无关(horizon-free)”。此外,我们给出了的样本复杂度下界,其与算法样本复杂度仅相差对数因子,表明算法最优。
引用
@article{arxiv.2303.10165,
title = {Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs},
author = {Junkai Zhang and Weitong Zhang and Quanquan Gu},
journal= {arXiv preprint arXiv:2303.10165},
year = {2024}
}
备注
37 pages, 1 figure, 2 tables. In ICML 2023