中文

实现离线强化学习的渐近最优样本复杂度:一种基于 DRO 的方法

机器学习 2024-10-01 v4

摘要

离线强化学习旨在从预先收集的数据集中学习而无需主动探索。该问题面临显著挑战,包括数据有限与分布偏移。现有方法通过对未充分探索的状态-动作对施加奖励惩罚以保守地估计价值函数,从而对不确定性持悲观态度。本文中,我们表明基于分布鲁棒优化(DRO)的方法同样可应对这些挑战,并且是{渐近极小极大最优}的。具体而言,我们直接对转移核中的不确定性建模,并构建统计上合理的转移核不确定性集合。随后我们证明,在该不确定性集合上优化最坏情况性能的策略在底层问题中具有近最优性能。我们首先设计一种基于度量的分布不确定性集合,使得真实转移核以高概率落于该集合内。我们证明,为达到 ϵ\epsilon 的次优性差距,样本复杂度为 O(S2Cπϵ2(1γ)4)\mathcal{O}(S^2C^{\pi^*}\epsilon^{-2}(1-\gamma)^{-4}),其中 γ\gamma 为折扣因子,SS 为状态数,CπC^{\pi^*} 为量化分布偏移的单策略截断可集中系数。为达到最优样本复杂度,我们进一步提出一种较不保守的基于价值函数的不确定性集合,但其不一定包含真实转移核。我们证明可获得改进的样本复杂度 O(SCπϵ2(1γ)3)\mathcal{O}(SC^{\pi^*}\epsilon^{-2}(1-\gamma)^{-3}),其渐近匹配离线强化学习的极小极大下界,从而是渐近极小极大最优的。

关键词

引用

@article{arxiv.2305.13289,
  title  = {Achieving the Asymptotically Optimal Sample Complexity of Offline Reinforcement Learning: A DRO-Based Approach},
  author = {Yue Wang and Jinjun Xiong and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2305.13289},
  year   = {2024}
}