离线和低自适应强化学习的统计复杂性分析
机器学习
2025-01-07 v1 人工智能
摘要
本文综述了近期在强化学习 (RL) 统计基础方面的最新进展。我们将首先论证为何离线 RL 是几乎任何真实世界 ML 问题的合适模型,尽管这些问题与最近使用 RL 实现 AI 突破无关。随后我们将深入探讨离线 RL 的两个基本问题:离线策略评估 (OPE) 和离线策略学习 (OPL)。可能令人惊讶的是,直到最近,针对这些问题的紧密界限甚至针对表格型和线性情况也未能得到知晓。我们阐明了最坏情况 minimax 界限与实例依赖界限之间的差异。我们还涵盖了 OPE 和 OPL 中近最优实例依赖方法背后的关键算法思想和证明技术。最后,我们讨论了离线 RL 的局限性,并综述了一项新兴问题——低自适应探索 (low-adaptive exploration),该问题通过在离线 RL 与在线 RL 之间提供理想的中间地带来了解这些局限性。
引用
@article{arxiv.2501.02089,
title = {On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures},
author = {Ming Yin and Mengdi Wang and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2501.02089},
year = {2025}
}
备注
Review Article