在在线强化学习中的重置的力量
机器学习
2024-04-29 v2 人工智能
机器学习
摘要
模拟器是强化学习中普遍的工具,但大多数现有算法无法有效利用模拟器访问——特别是在需要通用函数逼近的高维领域。我们通过在线强化学习中探索模拟器的力量,使用 local simulator access(或 local 规划)的 RL 协议,该协议允许 agent 在训练期间重置到之前观察到的状态并遵循其动力学。我们使用 local simulator access 来解锁以前无法触及的统计保证: - 我们表明,具有低 coverability 的 MDP(Xie 等 2023)——一种包含 Block MDP 和 Low-Rank MDP 的通用结构条件——可通过仅使用 -realizability(最优状态价值函数的可实现性)进行 sample-efficient 学习;现有的在线 RL 算法需要显著更强的表示条件。 - 作为结果,我们表明,著名的 Exogenous Block MDP 问题(Efroni 等 2022)在 local simulator access 下是可解的。上述结果是通过一种计算效率低下的算法实现的。我们补充了一种更计算效率高的算法 RVFS(Recursive Value Function Search),它在已知 pushforward coverability 这一更强统计假设下实现可证明的 sample complexity 保证。RVFS 可视为将递归搜索(如 MCTS)与价值函数逼近相结合的成功经验方法的一个原则且可证明的对应物。
引用
@article{arxiv.2404.15417,
title = {The Power of Resets in Online Reinforcement Learning},
author = {Zakaria Mhammedi and Dylan J. Foster and Alexander Rakhlin},
journal= {arXiv preprint arXiv:2404.15417},
year = {2024}
}
备注
Fixed a small typo