中文

有限状态演员-评论家均值动力学的全局吸引子与快慢化简

动力系统 2026-04-16 v1

摘要

当学习算法改变其训练数据分布时,长期行为取决于策略、价值估计和数据分布的联合演化。我们研究有限状态演员-评论家均值动力学于扩充相空间 (θ,w,μ)(\theta, w, \mu),其中 θ\theta 为演员参数,ww 为辅助评论家状态,μ\mu 为状态律变量(由当前策略诱导的分布)。状态律坐标遵循确切受控马尔可夫方程 δμ˙=Qθμ\delta \dot\mu = Q_\theta^* \mu。在软最大演员(参数裁剪的光滑代理)、均匀 coercive 线性评论家方程以及 Lipschitz 生成器族 θQθ\theta \mapsto Q_\theta 的假设下,我们证明对于每个 δ>0\delta > 0,结果自治半流动具有紧致全局吸引子。在均匀指数混合假设下,我们证明不变律映射 θμθ\theta \mapsto \mu_\theta 为 Lipschitz,并证明 (θ,w)(\theta, w) 上的简化不变律系统是可解的。在额外的路径下指数稳定性估计假设下,我们证明确切流在每个有限时间区间内跟随简化流至初始层,确切吸引子在 δ0\delta \to 0 时上半连续收敛于提升的简化吸引子。我们还给出具体的有限状态参考状态微小化条件,暗示路径下假设。所有结果均在Lean 4中形式化,无需自定义公理。

关键词

引用

@article{arxiv.2604.13259,
  title  = {Global attractors and fast-slow reduction for finite-state actor-critic mean dynamics},
  author = {Vladyslav Prytula},
  journal= {arXiv preprint arXiv:2604.13259},
  year   = {2026}
}

备注

15 pages, 2 figures