中文

最小化对抗性反事实误差于对抗强化学习

机器学习 2025-04-25 v4 人工智能

摘要

深度强化学习 (DRL) 政策对观察中的对抗噪声高度敏感,这在安全关键场景中构成重大风险。对抗性扰动固有的挑战在于,通过改变智能体所观察到的信息,导致状态仅部分可观测。现有方法要么通过在相邻状态间强制执行一致动作,要么通过最大化对抗性扰动观察中的最坏情况价值。然而,前者在攻击成功时会导致性能下降,后者则过于保守,导致良好环境下的次优性能。我们假设这些限制源于未能直接考虑部分可观测性。为此,我们提出一种新目标——对抗性反事实误差 (Adversarial Counterfactual Error, ACoE),其在关于真实状态信念的基础上,平衡价值优化与鲁棒性。为使 ACoE 在无模型设置下具可扩展性,我们提出了基于理论的代理目标累积型-ACoE (C-ACoE)。我们的实证评估在标准基准测试 (MuJoCo、Atari 和 Highway) 上表明,我们的方法在应对对抗性强化学习挑战方面显著优于当前最先进的方法,为改进 DRL 在对抗条件下的鲁棒性提供了前景的方向。我们的代码已公开于 https://github.com/romanbelaire/acoe-robust-rl。

关键词

引用

@article{arxiv.2406.04724,
  title  = {On Minimizing Adversarial Counterfactual Error in Adversarial RL},
  author = {Roman Belaire and Arunesh Sinha and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2406.04724},
  year   = {2025}
}

备注

Presented at ICLR 2025