中文

以仿制对手制胜:双人竞争博弈中的对抗策略模仿学习

机器学习 2022-11-01 v1

摘要

近期关于深度强化学习(RL)脆弱性的研究表明,对抗智能体所采用的对抗策略能够在多智能体环境中影响目标 RL 智能体(受害智能体)使其表现不佳。在现有研究中,对抗策略是基于与受害智能体交互的经验直接训练的。该方法存在一个关键缺陷:从历史交互中衍生的知识可能无法恰当地泛化到受害智能体未探索的策略区域,从而使得训练出的对抗策略效果显著下降。在本工作中,我们设计了一种克服该缺陷的新型高效对抗策略学习算法。我们新算法的核心思想是创建一个模仿器来模仿受害智能体的策略,同时对抗策略不仅基于与受害智能体的交互进行训练,还基于来自模仿器的反馈以预测受害者的意图。通过这样做,我们可利用模仿学习仅凭受害者的样本轨迹即可良好捕捉受害策略潜在特征的能力。我们的受害模仿学习模型不同于先前的模型,因为环境动态由对抗者的策略驱动,并会在对抗策略训练期间持续变化。我们提供了一个可证明的界,以在对抗者策略稳定时保证所需的模仿策略。我们进一步通过使模仿器成为受害者的更强版本来强化我们的对抗策略学习。最后,我们使用四个竞争性 MuJoCo 博弈环境的大量实验表明,我们提出的对抗策略学习算法优于最先进的算法。

关键词

引用

@article{arxiv.2210.16915,
  title  = {Imitating Opponent to Win: Adversarial Policy Imitation Learning in Two-player Competitive Games},
  author = {The Viet Bui and Tien Mai and Thanh H. Nguyen},
  journal= {arXiv preprint arXiv:2210.16915},
  year   = {2022}
}