中文

离线强化学习:状态聚合与轨迹数据的作用

机器学习 2024-03-27 v1 人工智能 机器学习

摘要

我们重新审视在价值函数可实现但无贝尔曼完备性条件下的离线强化学习问题。Xie 和 Jiang (2021) 以及 Foster 等人 (2022) 的前期工作留下了一个悬而未决的问题:有界的集中度系数结合基于轨迹的离线数据是否能带来多项式样本复杂度。在本工作中,我们针对离线策略评估任务给出了否定的答案。除了回答该问题,我们还为仅具有价值函数可实现性的离线策略评估提供了一幅相当完整的图景。我们的主要发现有三点:1) 离线策略评估的样本复杂度由聚合马尔可夫转移模型中的集中度系数决定,该模型由函数类和离线数据分布共同确定,而非原始 MDP 中的集中度系数。这统一并推广了 Xie 和 Jiang (2021) 以及 Foster 等人 (2022) 的思想;2) 即使原始 MDP 中的集中度系数很小且离线数据是可采纳的(即数据分布等于某个策略的占用测度),聚合马尔可夫转移模型中的集中度系数也可能随视野长度呈指数增长;3) 在价值函数可实现性下,存在一个通用的归约方法,可将任何具有可采纳数据的困难实例转化为具有轨迹数据的困难实例,这意味着轨迹数据相比可采纳数据并无额外优势。这三点共同解决了该开放问题,尽管每一点都可能具有独立的研究价值。

关键词

引用

@article{arxiv.2403.17091,
  title  = {Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data},
  author = {Zeyu Jia and Alexander Rakhlin and Ayush Sekhari and Chen-Yu Wei},
  journal= {arXiv preprint arXiv:2403.17091},
  year   = {2024}
}