中文

线性马尔可夫决策过程中的乐观 Actor-Critic 与参数化策略

机器学习 2026-04-02 v2 机器学习

摘要

尽管 actor-critic 方法在实践中取得了成功,但其理论分析存在若干局限性。具体而言,现有的理论工作要么通过强假设回避探索问题,要么分析具有复杂算法修改的不实用方法。此外,针对线性 MDPs 分析的 actor-critic 方法通常采用自然策略梯度并构建没有显式参数化的"隐式"策略。从这些策略中采样计算代价高昂,使得环境交互效率低下。为此,我们聚焦有限时间视界的线性 MDPs,提出了一种使用参数化 log-linear 策略的乐观 actor-critic 框架。具体而言,我们为 actor 引入了一个可处理的 logit-matching 回归目标。对于 critic,我们使用通过 Langevin Monte Carlo 进行的近似 Thompson 采样来获得乐观价值估计。我们证明所得算法在在策略和离策略设置中分别达到 O~(ϵ4)\widetilde{\mathcal{O}}(\epsilon^{-4})O~(ϵ2)\widetilde{\mathcal{O}}(\epsilon^{-2}) 样本复杂度。我们的结果在达到最先进的样本复杂度方面与先前理论工作一致,而我们的算法更贴近实践。

关键词

引用

@article{arxiv.2603.28595,
  title  = {Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes},
  author = {Max Qiushi Lin and Reza Asad and Kevin Tan and Haque Ishfaq and Csaba Szepesvari and Sharan Vaswani},
  journal= {arXiv preprint arXiv:2603.28595},
  year   = {2026}
}

备注

61 pages, 9 figures