中文

强化学习中的参数压力分析:将突触滤波应用于策略网络

高能物理 - 理论 2026-05-28 v5

摘要

本文探索了强化学习(RL)策略鲁棒性,通过系统性地分析网络参数在 internal 和 external 压力下的行为。我们应用来自 \citep{pravin2024fragility} 的突触滤波方法,使用高通、低通和脉冲波滤波器作为 internal 压力,通过选择性扰动参数来实现,而对抗性攻击则通过修改 agent 观察来应用 external 压力。这种双重方法使我们能够根据参数对策略在 clean 和 adversarial 设置下的性能影响,将参数分类为 \textit{fragile}(脆弱的)、\textit{robust}(稳健的)或 \textit{antifragile}(抗击的)。定义参数得分以量化这些特征,并在基于近似策略优化(PPO)训练的 Mujoco 连续控制环境中对框架进行验证。结果突出了在压力下增强策略性能的抗击参数的存在,表明有针对性的滤波技术有望提高 RL 策略的适应性。这些见解为未来在稳健和抗击 RL 系统设计方面的发展提供了基础。

关键词

引用

@article{arxiv.2506.23035,
  title  = {When Black Holes Relax in a Cold Bath: Evolving Page Curves for Black Holes Coupled to Cooling Baths},
  author = {Waheed A. Dar and Nirmalya Kajuri and Rinkesh Panigrahi},
  journal= {arXiv preprint arXiv:2506.23035},
  year   = {2026}
}

备注

22 pages, 11 figures. Matches published version