线性马尔可夫决策过程中的乐观 Actor-Critic 与参数化策略
机器学习
2026-04-02 v2 机器学习
摘要
尽管 actor-critic 方法在实践中取得了成功,但其理论分析存在若干局限性。具体而言,现有的理论工作要么通过强假设回避探索问题,要么分析具有复杂算法修改的不实用方法。此外,针对线性 MDPs 分析的 actor-critic 方法通常采用自然策略梯度并构建没有显式参数化的"隐式"策略。从这些策略中采样计算代价高昂,使得环境交互效率低下。为此,我们聚焦有限时间视界的线性 MDPs,提出了一种使用参数化 log-linear 策略的乐观 actor-critic 框架。具体而言,我们为 actor 引入了一个可处理的 logit-matching 回归目标。对于 critic,我们使用通过 Langevin Monte Carlo 进行的近似 Thompson 采样来获得乐观价值估计。我们证明所得算法在在策略和离策略设置中分别达到 和 样本复杂度。我们的结果在达到最先进的样本复杂度方面与先前理论工作一致,而我们的算法更贴近实践。
引用
@article{arxiv.2603.28595,
title = {Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes},
author = {Max Qiushi Lin and Reza Asad and Kevin Tan and Haque Ishfaq and Csaba Szepesvari and Sharan Vaswani},
journal= {arXiv preprint arXiv:2603.28595},
year = {2026}
}
备注
61 pages, 9 figures