策略网络泛化分析:以双积分器系统为例
机器学习
2024-01-02 v2 人工智能
系统与控制
系统与控制
摘要
深度强化学习 (DRL) 策略网络在各类连续控制任务中的广泛应用,引发了关于其在输入状态范数大于训练环境的广阔状态空间中性能退化的问题。本文旨在利用一种称为状态划分的新颖分析技术,揭示处理扩展状态空间时导致此类性能下降的潜在因素。与先前仅将状态划分作为事后解释工具的方法不同,我们的方法深入探讨了 DRL 策略网络的内在特性。具体而言,我们证明了状态空间的扩展会导致激活函数 呈现饱和性,从而使状态划分边界从非线性转变为线性。我们的分析以双积分器系统为范式,揭示了这种向线性的逐渐转变赋予了类似于 bang-bang 控制的控制行为。然而,划分边界的固有线性阻碍了理想 bang-bang 控制的实现,从而引入了不可避免的超调。我们采用多种 RL 算法进行的实验研究证实,这种性能现象源于 DRL 策略网络的固有属性,并在各种优化算法中保持一致。
引用
@article{arxiv.2312.10472,
title = {Analyzing Generalization in Policy Networks: A Case Study with the Double-Integrator System},
author = {Ruining Zhang and Haoran Han and Maolong Lv and Qisong Yang and Jian Cheng},
journal= {arXiv preprint arXiv:2312.10472},
year = {2024}
}