最大化以探索:融合估计、规划与探索的单一目标函数
机器学习
2023-10-26 v2 人工智能
计算机科学与博弈论
最优化与控制
机器学习
摘要
在在线强化学习(online RL)中,平衡探索与利用对于以样本高效的方式找到最优策略至关重要。为此,现有样本高效的在线RL算法通常由三个组件构成:估计、规划与探索。然而,为了应对通用函数逼近器,其中大多数涉及不切实际的算法组件来激励探索,例如数据依赖水平集内的优化或复杂的采样过程。为应对这一挑战,我们提出了一种易于实现的RL框架,称为Maximize to Explore (MEX),它仅需对单一目标进行无约束优化,该目标集成了估计与规划组件,同时自动平衡探索与利用。理论上,我们证明MEX在马尔可夫决策过程(MDP)的通用函数逼近下实现了次线性后悔(regret),并可进一步扩展到两人零和马尔可夫博弈(MG)。同时,我们调整深度RL基线以设计MEX的实用版本,采用无模型与基于模型两种方式,在具有稀疏奖励的各类MuJoCo环境中能以稳定优势超越基线。与现有具备通用函数逼近的样本高效在线RL算法相比,MEX实现了相似的样本效率,同时享有更低的计算成本,并且与现代深度RL方法更兼容。
引用
@article{arxiv.2305.18258,
title = {Maximize to Explore: One Objective Function Fusing Estimation, Planning, and Exploration},
author = {Zhihan Liu and Miao Lu and Wei Xiong and Han Zhong and Hao Hu and Shenao Zhang and Sirui Zheng and Zhuoran Yang and Zhaoran Wang},
journal= {arXiv preprint arXiv:2305.18258},
year = {2023}
}