通过 $\epsilon$-贪婪探索理解强化学习中的深度神经函数逼近
机器学习
2022-10-18 v2
摘要
本文对在线设定下采用 -贪婪探索的强化学习(RL)中深度神经函数逼近问题进行了理论研究。该问题设定受成功的深度 Q 网络(DQN)框架启发,而 DQN 即属于此范式。本文首次尝试从函数类与神经网络架构(如宽度和深度)的视角,超越“线性” regime 对深度 RL 进行理论理解。具体而言,我们关注基于价值的算法,其通过分别由 Besov(和 Barron)函数空间赋予的深度(及两层)神经网络以 -贪婪探索逼近 维特征空间中的 -光滑 Q 函数。我们证明,对于 轮交互,在 Besov 空间中,将深度 RL 神经网络的宽度缩放为 、深度缩放为 足以实现亚线性后悔学习。此外,对于由 Barron 空间赋予的两层神经网络,将宽度缩放为 即已足够。为此,我们分析中的关键问题是如何在深度神经函数逼近下估计时序差分误差,因为 -贪婪探索不足以保证“乐观性”。我们的分析将时序差分误差重新表述为关于某平均测度 的 -可积空间中的量,并将其转化为非独立同分布设定下的泛化问题。这本身可能对 RL 理论中更好地理解深度 RL 中的 -贪婪探索具有独立意义。
引用
@article{arxiv.2209.07376,
title = {Understanding Deep Neural Function Approximation in Reinforcement Learning via $\epsilon$-Greedy Exploration},
author = {Fanghui Liu and Luca Viano and Volkan Cevher},
journal= {arXiv preprint arXiv:2209.07376},
year = {2022}
}
备注
Accepted by NeurIPS22