策略空间压缩问题的统计分析
机器学习
2024-11-18 v1 人工智能
机器学习
摘要
策略搜索方法在强化学习中至关重要,为解决连续状态-动作和部分可观测问题提供了框架。然而,探索庞大策略空间的复杂性可能导致显著的低效。通过策略压缩减小策略空间成为一种强大的、无需奖励的加速学习过程的方法。该技术将策略空间压缩为一个更小的代表性集合,同时保持大部分原始有效性。我们的研究重点在于确定准确学习该压缩集合所需的样本量。我们采用雷尼散度来度量真实与估计策略分布之间的相似性,建立良好近似的误差界。为简化分析,我们使用l1范数,确定了基于模型和无模型设置下的样本量需求。最后,我们将l1范数得出的误差界与雷尼散度得出的误差界相关联,区分靠近顶点的策略和处于策略空间中间的策略,以确定所需样本量的下界和上界。
引用
@article{arxiv.2411.09900,
title = {Statistical Analysis of Policy Space Compression Problem},
author = {Majid Molaei and Marcello Restelli and Alberto Maria Metelli and Matteo Papini},
journal= {arXiv preprint arXiv:2411.09900},
year = {2024}
}