RoMFAC:一种抵御状态对抗扰动的鲁棒平均场 actor-critic 强化学习
机器学习
2023-06-01 v2 人工智能
摘要
多智能体深度强化学习依赖于智能体观测到的系统状态做出最优决策,但对观测的任何不确定性都可能误导智能体采取错误动作。平均场 Actor-Critic 强化学习(MFAC)因能有效处理可扩展性问题而在多智能体领域广为人知。然而,它对状态扰动敏感,会显著削弱团队奖励。本工作提出一种鲁棒平均场 Actor-Critic 强化学习(RoMFAC),具有两项创新:1)训练 actor 的新目标函数,由与采样干净状态下的期望累积折扣奖励相关的策略梯度函数,以及表示干净状态与对抗状态下所采取动作之间差异的动作损失函数组成;2)对动作损失进行重复正则化,确保训练后的 actor 获得优异性能。此外,本工作提出一个名为状态对抗随机博弈(SASG)的博弈模型。尽管 SASG 的纳什均衡可能不存在,但基于 SASG 证明了 RoMFAC 中对状态的对抗扰动是可防御的。实验结果表明,RoMFAC 在抵御对抗扰动的同时,在无扰动环境中保持了其竞争性能。
引用
@article{arxiv.2205.07229,
title = {RoMFAC: A robust mean-field actor-critic reinforcement learning against adversarial perturbations on states},
author = {Ziyuan Zhou and Guanjun Liu},
journal= {arXiv preprint arXiv:2205.07229},
year = {2023}
}