中文

基于 Bellman 无穷误差的最优对抗鲁棒 Q-learning 探索

机器学习 2024-06-24 v2

摘要

建立鲁棒策略对于抵御影响深度强化学习(DRL)智能体的攻击或干扰至关重要。近期的研究探讨了状态对抗鲁棒性,并提出可能不存在最优鲁棒策略(ORP),这为设定严格的鲁棒性约束带来了挑战。本研究进一步探讨了 ORP:首先,我们引入了策略一致性假设(CAP),指出在马尔可夫决策过程中,最优动作在微小扰动下保持一致,这一假设得到了经验和理论证据的支持。基于 CAP,我们关键性地证明了存在与 Bellman 最优策略相一致的确定性且平稳的 ORP。此外,我们阐明了在最小化 Bellman 误差以获得 ORP 时使用 LL^{\infty}-范数的必要性。这一发现澄清了先前以 L1L^{1}-范数逼近 Bellman 最优策略的 DRL 算法的脆弱性,并促使我们通过最小化 Bellman 无穷误差的替代项来训练一致性对抗鲁棒深度 Q 网络(CAR-DQN)。CAR-DQN 在各项基准测试中的顶尖表现验证了其实际有效性,并印证了理论分析的可靠性。

关键词

引用

@article{arxiv.2402.02165,
  title  = {Towards Optimal Adversarial Robust Q-learning with Bellman Infinity-error},
  author = {Haoran Li and Zicheng Zhang and Wang Luo and Congying Han and Yudong Hu and Tiande Guo and Shichen Liao},
  journal= {arXiv preprint arXiv:2402.02165},
  year   = {2024}
}