悲观离线强化学习的神经网络逼近
机器学习
2023-12-20 v1 人工智能
机器学习
摘要
深度强化学习(RL)在特定的离线决策场景中取得了显著成功,但其理论保证仍在发展之中。现有的离线 RL 理论工作主要强调少数平凡设置,例如线性 MDP 或具有强假设和独立数据的一般函数逼近,这些对实际应用缺乏指导意义。深度学习与 Bellman 残差的耦合使得该问题具有挑战性,此外还有数据依赖的困难。在本文中,我们在温和假设下,利用一般神经网络逼近和 -混合数据,建立悲观离线 RL 关于网络结构、数据集维度和数据覆盖集中度的非渐近估计误差。我们的结果表明,估计误差由两部分组成:第一部分在样本量上以期望的速率收敛至零,且具有部分可控的集中度;第二部分在残差约束严格时变得可忽略。该结果证明了深度对抗离线 RL 框架的显式有效性。我们利用针对 -混合序列的经验过程工具和针对 Hölder 类的神经网络逼近理论来实现这一点。我们还开发了方法来界定由经验 Bellman 约束扰动下函数逼近引起的 Bellman 估计误差。此外,我们提出了一个结果,利用具有低内在维度的数据和低复杂度的函数类来减轻维度灾难。我们的估计为深度离线 RL 的发展提供了有价值的见解,并为算法模型设计提供了指导。
引用
@article{arxiv.2312.11863,
title = {Neural Network Approximation for Pessimistic Offline Reinforcement Learning},
author = {Di Wu and Yuling Jiao and Li Shen and Haizhao Yang and Xiliang Lu},
journal= {arXiv preprint arXiv:2312.11863},
year = {2023}
}
备注
Full version of the paper accepted to the 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024)