在最小假设下实现单环Actor-Critic的ε⁻²样本复杂度
机器学习
2026-05-14 v1 最优化与控制
机器学习
摘要
本文建立了针对强化学习中基于离策略Actor-Critic方法的最后收敛率的分析。特别是在单环、单时间尺度实现和广泛的政策更新类(包括近似政策迭代和自然政策梯度方法)下,我们证明了在最小假设(即存在一个能诱导不可约马尔可夫链的政策)下,寻找ε最优政策的第一个˜O(ε⁻²)样本复杂度保证。这与现有文献形成鲜明对比;在现有文献中,仅通过嵌套循环更新和/或针对政策实施强算法相关假设(如均匀混合和均匀探索)才能实现˜O(ε⁻²)样本复杂度。技术上,为了应对单环实现所导致的耦合更新方程以及离策略学习可能导致的无界迭代挑战,我们的分析基于耦合Lyapunov漂移框架。具体而言,我们为演员建立了几何收敛率,为评论家建立了˜O(1/T)收敛率,并通过一种交叉支配属性将两种Lyapunov漂移不等式相结合。我们认为,这种分析框架本身也具有独立的兴趣,可能适用于其他具有耦合迭代算法的无界问题。
引用
@article{arxiv.2605.13639,
title = {Achieving $\epsilon^{-2}$ Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions},
author = {Ishaq Hamza and Zaiwei Chen},
journal= {arXiv preprint arXiv:2605.13639},
year = {2026}
}