当学习率出错时:PPO演员-评论家中的早期结构信号
机器学习
2026-03-11 v1 人工智能
摘要
深度强化学习系统对学习率(LR)高度敏感,选择稳定且性能优异的训练运行通常需要 extensive 的超参数搜索。在PPO演员-评论家方法中,较小的LR值导致收敛缓慢,而较大的LR值可能引发不稳定或崩溃。我们从隐藏神经元的行为出发分析这一现象,使用过拟合-欠拟合指示器(OUI)衡量网络中二进制激活模式在固定探针批次上的平衡度。我们引入了OUI的高效基于批次的公式,并推导出LR与激活符号变化之间的理论联系,阐明了神经元内部结构正确演化如何取决于步长。经验上,在三个离散控制环境中进行多个随机种子实验表明,仅在10%的训练中即可测得的OUI就能在LR区间之间进行区分。我们观察到一致的非对称性:实现最高回报的评论家网络 operating 在中间OUI带(避免饱和),而实现最高回报的演员网络则表现出较高的OUI值。我们随后将OUI基于的筛选规则与早期回报、裁切-based、发散-based和翻转-based准则进行比较,在成功运行的召回率匹配的情况下,OUI提供了最强的早期筛选信号:OUI alone 在更广泛的召回率下实现最佳精度,而将早期回报与OUI组合可在最佳表现的筛选 regime 中实现最高精度,使我们能够在不进行完整训练的情况下积极剔除不具前景的运行。
关键词
引用
@article{arxiv.2603.09950,
title = {When Learning Rates Go Wrong: Early Structural Signals in PPO Actor-Critic},
author = {Alberto Fernández-Hernández and Cristian Pérez-Corral and Jose I. Mestre and Manuel F. Dolz and Jose Duato and Enrique S. Quintana-Ortí},
journal= {arXiv preprint arXiv:2603.09950},
year = {2026}
}