中文

策略空间压缩问题的统计分析

机器学习 2024-11-18 v1 人工智能 机器学习

摘要

策略搜索方法在强化学习中至关重要,为解决连续状态-动作和部分可观测问题提供了框架。然而,探索庞大策略空间的复杂性可能导致显著的低效。通过策略压缩减小策略空间成为一种强大的、无需奖励的加速学习过程的方法。该技术将策略空间压缩为一个更小的代表性集合,同时保持大部分原始有效性。我们的研究重点在于确定准确学习该压缩集合所需的样本量。我们采用雷尼散度来度量真实与估计策略分布之间的相似性,建立良好近似的误差界。为简化分析,我们使用l1范数,确定了基于模型和无模型设置下的样本量需求。最后,我们将l1范数得出的误差界与雷尼散度得出的误差界相关联,区分靠近顶点的策略和处于策略空间中间的策略,以确定所需样本量的下界和上界。

关键词

引用

@article{arxiv.2411.09900,
  title  = {Statistical Analysis of Policy Space Compression Problem},
  author = {Majid Molaei and Marcello Restelli and Alberto Maria Metelli and Matteo Papini},
  journal= {arXiv preprint arXiv:2411.09900},
  year   = {2024}
}