中文

策略镜像下降天然探索动作空间

机器学习 2023-03-22 v2 人工智能 最优化与控制

摘要

在有限状态和动作空间上求解一般强化学习问题时,动作空间中的显式探索曾被认为是在线策略梯度方法避免样本复杂度急剧恶化的必要条件。本文首次建立了不引入任何探索策略的在线策略梯度方法的 O~(1/ϵ2)\tilde{\mathcal{O}}(1/\epsilon^2) 样本复杂度。核心进展包括两个新的同策略评估算子和随机策略镜像下降方法(SPMD)的新分析。采用第一种评估算子(称为基于价值的估计)的 SPMD 适用于 Kullback-Leibler 散度。若所生成策略在状态空间上的马尔可夫链以非递减的最小访问测度一致混合,则可获得对动作空间大小呈线性依赖的 O~(1/ϵ2)\tilde{\mathcal{O}}(1/\epsilon^2) 样本复杂度。采用第二种评估算子即截断同策略蒙特卡洛(TOMC)的 SPMD 达到了 O~(HD/ϵ2)\tilde{\mathcal{O}}(\mathcal{H}_{\mathcal{D}}/\epsilon^2) 样本复杂度,其中 HD\mathcal{H}_{\mathcal{D}} 在适当选取 Bregman 散度(如 Tsallis 散度)时温和依赖于有效时域与动作空间大小。带 TOMC 的 SPMD 还展现出更强的收敛性质,因其以高概率而非期望意义控制最优性差距。与显式探索不同,这些新策略梯度方法可避免在搜索最优策略时反复执行潜在高风险动作。

关键词

引用

@article{arxiv.2303.04386,
  title  = {Policy Mirror Descent Inherently Explores Action Space},
  author = {Yan Li and Guanghui Lan},
  journal= {arXiv preprint arXiv:2303.04386},
  year   = {2023}
}