中文

策略优化中最优性与对抗鲁棒性之间的张力

机器学习 2025-12-02 v1

摘要

在深度强化学习中实现最优性与对抗鲁棒性长期以来被视为相互冲突的目标。然而,CAR 中提出的近期理论洞察表明两者可能存在一致性,这引发了如何在实践中实现这一目标的重要问题。本文首先通过对比标准策略优化(SPO)与对抗鲁棒策略优化(ARPO),识别出理论与实践之间的关键差距。尽管二者在理论上具有一致性,但在实际策略梯度方法中,鲁棒性与最优性之间产生了根本性的张力。SPO 倾向于收敛到脆弱的一阶驻定策略(FOSPs),具有较强的自然性能,而 ARPO 通常偏好更具鲁棒性的 FOSPs,但以降低回报为代价。此外,我们将这种权衡归因于 ARPO 中最强对抗者的重塑效应,该效应通过诱导欺骗性的粘性 FOSPs 显著复杂化了全局景观。这提升了鲁棒性,但使导航更加困难。为缓解这一问题,我们开发了 BARPO,一个统一 SPO 和 ARPO 的双层框架,通过调节对抗者强度来促进可导航性,同时保持全局最优性。大量实证结果表明,BARPO 一致性地优于 vanilla ARPO,为调和理论与实证性能提供了实用方法。

关键词

引用

@article{arxiv.2512.01228,
  title  = {On the Tension Between Optimality and Adversarial Robustness in Policy Optimization},
  author = {Haoran Li and Jiayu Lv and Congying Han and Zicheng Zhang and Anqi Li and Yan Liu and Tiande Guo and Nan Jiang},
  journal= {arXiv preprint arXiv:2512.01228},
  year   = {2025}
}