Wasserstein流遇上复制动力学:Actor-Critic中表征学习的平均场分析
机器学习
2024-04-02 v2 最优化与控制
机器学习
摘要
由神经网络赋能的Actor-Critic (AC)算法近年来取得显著实证成功。然而,现有对AC算法的理论支持多聚焦于线性函数近似或线性化神经网络情形,其中特征表征在训练全程固定。该局限未能捕捉神经AC中表征学习这一关键方面,而后者在实际问题中至关重要。本工作中,我们从平均场视角考察基于特征的神经AC的演化与收敛。具体而言,我们考虑一种AC版本,其中actor与critic由过参数化两层神经网络表示,并以两时间尺度学习率更新。critic通过时间差分(TD)学习以较大步长更新,而actor通过近端策略优化(PPO)以较小步长更新。在连续时间与无限宽度极限下,当时间尺度适当分离时,我们证明神经AC以亚线性速率找到全局最优策略。此外,我们证明critic网络诱导的特征表征可在初始表征的邻域内演化。
引用
@article{arxiv.2112.13530,
title = {Wasserstein Flow Meets Replicator Dynamics: A Mean-Field Analysis of Representation Learning in Actor-Critic},
author = {Yufeng Zhang and Siyu Chen and Zhuoran Yang and Michael I. Jordan and Zhaoran Wang},
journal= {arXiv preprint arXiv:2112.13530},
year = {2024}
}
备注
41 pages, accepted to NeurIPS 2021, add acknowledgement