双重悲观主义在分布鲁棒离线强化学习中可被证明是高效的:通用算法与鲁棒部分覆盖
机器学习
2023-08-23 v2 人工智能
最优化与控制
机器学习
摘要
本文研究分布鲁棒离线强化学习(鲁棒离线 RL),其旨在仅从离线数据集寻找能在扰动环境中表现良好的最优策略。具体而言,我们提出一种称为双重悲观基于模型的策略优化()的通用算法框架,其特点是将灵活的模型估计子过程与双重悲观策略优化步骤新颖结合。值得注意的是,双重悲观原则对克服由(i)行为策略与目标策略间失配;以及(ii)标称模型扰动所引起的分布偏移至关重要。在模型估计子过程的特定精度条件下,我们证明 在鲁棒部分覆盖数据下是样本高效的,这仅要求离线数据对最优鲁棒策略所诱导的分布及标称模型周围的扰动模型具有良好覆盖。通过为 RMDPs 的具体实例(包括表格 RMDPs、因子 RMDPs、核与神经 RMDPs)定制特定模型估计子过程,我们证明 享有 收敛速率,其中 为数据集大小。我们强调,除表格 RMDPs 外,所有这些实例均由本工作首次识别并证明可处理。此外,我们在鲁棒马尔可夫博弈(RMGs)中继续研究鲁棒离线 RL。通过扩展为单智能体 RMDPs 所识别的双重悲观原则,我们提出另一算法框架,可仅利用鲁棒单边(部分)覆盖数据高效寻找玩家间的鲁棒纳什均衡。据我们所知,本工作提出了首个面向鲁棒离线 RL 的通用学习原则——双重悲观主义——并表明其在通用函数逼近下可被证明是高效的。
引用
@article{arxiv.2305.09659,
title = {Double Pessimism is Provably Efficient for Distributionally Robust Offline Reinforcement Learning: Generic Algorithm and Robust Partial Coverage},
author = {Jose Blanchet and Miao Lu and Tong Zhang and Han Zhong},
journal= {arXiv preprint arXiv:2305.09659},
year = {2023}
}
备注
V2 adds results on robust offline Markov games