基于增广拉格朗日法的一般函数逼近最优保守离线强化学习
机器学习
2022-11-03 v1 人工智能
最优化与控制
统计理论
机器学习
统计理论
摘要
离线强化学习(RL)指从先前收集的交互数据集中进行决策,近年来受到广泛关注。许多工作致力于通过各类保守策略学习解决普遍存在的部分数据覆盖问题,以提升离线RL的实用性。尽管大多数算法不具备有限样本保证,已有若干可证明的保守离线RL算法在可处理部分覆盖的单策略集中性框架下被设计与分析。然而,在难以获得置信区间的非线性函数逼近设定下,现有可证明算法存在计算难解、假设过强以及统计速率次优的问题。本文利用RL的边缘化重要性采样(MIS)公式,提出首套在一般函数逼近与单策略集中性下统计最优且实用的离线RL算法,规避了不确定性量化的需求。我们指出成功求解MIS问题的基于样本的近似的关键在于确保某些占据率有效性约束近似满足。我们通过增广拉格朗日法的新颖应用来强制这些约束,并证明如下结果:在MIS公式下,增广拉格朗日足以实现统计最优的离线RL。与先前通过行为正则化等方法引入额外保守性的算法形成鲜明对比,我们的方法可证明地消除了这一需求,并将正则化项重新诠释为“占据率有效性的执行者”而非“保守性的促进者”。
引用
@article{arxiv.2211.00716,
title = {Optimal Conservative Offline RL with General Function Approximation via Augmented Lagrangian},
author = {Paria Rashidinejad and Hanlin Zhu and Kunhe Yang and Stuart Russell and Jiantao Jiao},
journal= {arXiv preprint arXiv:2211.00716},
year = {2022}
}
备注
49 pages, 1 figure