价值与密度比可实现性下的离线强化学习:间隔假设的作用
机器学习
2022-06-16 v3 机器学习
摘要
我们考虑离线强化学习(RL)中一个具有挑战性的理论问题:在数据集缺乏充分覆盖、且仅对函数逼近器作可实现性类型假设的条件下,获得样本效率保证。现有理论已分别处理了在可实现性下和学习在非探索性数据下的情形,但尚无工作能同时处理两者(除了一篇我们详细比较的同期工作)。在额外的间隔假设下,我们为一个基于由边缘化重要性采样(MIS)构成的版本空间的简单悲观算法提供了保证,且该保证仅要求数据覆盖最优策略,以及函数类能实现最优价值和密度比函数。尽管类似的间隔假设已用于 RL 理论的其他领域,我们的工作是首个在弱函数逼近的离线 RL 中识别间隔假设的效用及其新机制的。
引用
@article{arxiv.2203.13935,
title = {Offline Reinforcement Learning Under Value and Density-Ratio Realizability: The Power of Gaps},
author = {Jinglin Chen and Nan Jiang},
journal= {arXiv preprint arXiv:2203.13935},
year = {2022}
}