基于核与神经函数近似的无奖励强化学习:单智能体 MDP 与马尔可夫博弈
机器学习
2022-02-15 v2 计算机科学与博弈论
机器学习
摘要
为实现强化学习(RL)中的样本效率,必须对底层环境进行有效探索。在离线设定下,应对探索挑战的关键在于收集具有充分覆盖度的离线数据集。受此挑战驱动,我们研究无奖励 RL 问题,其中智能体旨在无任何预指定奖励函数的情况下彻底探索环境。随后,给定任意外在奖励,智能体通过规划算法利用探索阶段收集的离线数据计算策略。此外,我们在函数近似背景下利用强大的函数近似器来解决该问题。具体而言,我们提出通过结合核与神经函数近似的价值迭代算法的乐观变体进行探索,其中采用相应的探索奖励作为探索红利。而且,我们为单智能体 MDP 和零和马尔可夫博弈设计了探索与规划算法,并证明当给定任意外在奖励时,我们的方法对生成 ε-次优策略或 ε-近似纳什均衡可达到 的样本复杂度。据我们所知,我们建立了首个可证明高效的无奖励 RL 算法,其采用核与神经函数近似器。
引用
@article{arxiv.2110.09771,
title = {On Reward-Free RL with Kernel and Neural Function Approximations: Single-Agent MDP and Markov Game},
author = {Shuang Qiu and Jieping Ye and Zhaoran Wang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2110.09771},
year = {2022}
}
备注
ICML 2021