基于有界理性课程学习的鲁棒对抗强化学习
机器学习
2023-11-06 v1
摘要
抵御对抗攻击与分布偏移是强化学习(RL)长期以来的目标。为此,鲁棒对抗强化学习(RARL)在竞争性的零和马尔可夫博弈中训练主角对抗由对手施加的破坏力,其最优解(即理性策略)对应于纳什均衡。然而,寻找纳什均衡需要面对复杂的鞍点优化问题,这类问题可能难以求解,尤其对于高维控制。本文提出一种基于熵正则化的对抗 RL 新方法,以缓解鞍点优化问题的复杂性。我们证明该熵正则化问题的解对应于量化响应均衡(QRE),它是纳什均衡的推广,考虑了有界理性,即智能体有时采取随机动作而非最优动作。关键在于,熵正则化目标与 QRE 之间的联系使得仅通过调节温度系数即可自由调控智能体的理性程度。我们利用这一见解提出新算法量化对抗 RL(QARL),它以课程式方式逐步提升对手的理性直至其完全理性,在保持鲁棒性的同时降低优化问题复杂度。我们提供了大量证据,表明 QARL 在多个 MuJoCo 运动与导航任务上的总体性能与鲁棒性均优于 RARL 及近期基线方法。
引用
@article{arxiv.2311.01642,
title = {Robust Adversarial Reinforcement Learning via Bounded Rationality Curricula},
author = {Aryaman Reddi and Maximilian Tölle and Jan Peters and Georgia Chalvatzaki and Carlo D'Eramo},
journal= {arXiv preprint arXiv:2311.01642},
year = {2023}
}
备注
Under review