中文

协作且个性化的策略训练:单时间尺度联邦 Actor-Critic

机器学习 2026-05-15 v1 人工智能

摘要

尽管 actor-critic 方法广受欢迎且协作策略训练存在实际需求,但现有工作通常要么忽略环境异构性,要么通过在所有 agent 间训练单一共享策略而完全放弃个性化。我们考虑一个联邦 actor-critic 框架,其中 agent 共享公共线性子空间表示,同时保持个性化的局部策略组件,并迭代估计公共子空间、局部 critic 头和局部策略(即 actor)。在采用马尔可夫采样的规范单时间尺度更新下,我们通过一种新颖的联合线性近似框架建立了有限时间收敛性。具体而言,我们证明 critic 误差以 O~(1/((1γ)4TK))\tilde{\mathcal{O}}(1/((1-\gamma)^4\sqrt{TK})) 的速率收敛至零,策略梯度范数以 O~(1/((1γ)6TK))\tilde{\mathcal{O}}(1/((1-\gamma)^6\sqrt{TK})) 的速率收敛至零,其中 TT 为轮数,KK 为 agent 数量,γ(0,1)\gamma\in (0,1) 为折扣因子。这些结果证明了相对于 agent 数量 KK 的线性加速,尽管在不同转移核与耦合学习动力学下的马尔可夫轨迹是异构的。为应对这些挑战,我们针对投影子空间更新和 QR 分解步骤开发了新的扰动分析,并结合了针对异构马尔可夫噪声的条件混合论证。此外,为处理由策略更新与时间依赖性引入的额外复杂性,我们建立了在马尔可夫采样下与在时间冻结策略下函数评估之间差异的精细刻画。实验在联邦 \texttt{Hopper-v5} action-map 异构性下将此框架实例化于 PPO 中,展示了相对于 Single PPO 和 FedAvg PPO 的性能提升,以及从学习到的共享主干向下游的迁移。

关键词

引用

@article{arxiv.2605.14423,
  title  = {Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic},
  author = {Leo Muxing Wang and Pengkun Yang and Lili Su},
  journal= {arXiv preprint arXiv:2605.14423},
  year   = {2026}
}