中文

强化学习中的参数压力分析:应用突触滤波到策略网络

机器学习 2026-03-06 v3 系统与控制 系统与控制

摘要

本文通过系统性地分析网络参数在内部和外部压力下的表现,探索强化学习(RL)策略的鲁棒性。我们应用从\textcolor{black}{[引用删除]}中提取的高通、低通和脉冲波滤波器作为内部压力,通过选择性扰动参数实现,而对抗性攻击则通过修改智能体观察来实现外部压力。这种双重方法使我们能够基于参数对干净和对抗环境中策略性能的影响,将参数分类为 fragile(脆弱的)、robust(稳健的)或 antifragile(抗压力的)。定义参数得分以量化这些特征,并在MuJoCo连续控制环境中使用近端策略优化(PPO)训练的智能体上验证该框架。结果突出了在压力下增强策略性能的抗压力参数的存在,表明有针对性的滤波技术有潜力提高RL策略的可适应性。这些见解为未来发展稳健和抗压力的RL系统提供了基础。

关键词

引用

@article{arxiv.2506.23036,
  title  = {Parameter Stress Analysis in Reinforcement Learning: Applying Synaptic Filtering to Policy Networks},
  author = {Zain ul Abdeen and Ming Jin},
  journal= {arXiv preprint arXiv:2506.23036},
  year   = {2026}
}