中文

用于对抗训练的神经扰动领导者跟随算法

机器学习 2020-06-09 v2 计算机科学与博弈论 机器学习

摘要

学习的博弈论模型是一组优化多目标架构的强大模型。其中零和架构启发了对抗学习框架。这些零和架构的一个重要缺陷是基于梯度的训练导致弱收敛和循环动态。我们提出一种用于零和架构的跟随领导者训练算法,保证收敛到混合纳什均衡而无循环行为。它是一种特殊的跟随扰动领导者算法,其中扰动由一个神经中介智能体产生。我们通过对具有凸和非凸损失的博弈以及生成对抗架构应用该训练算法来验证理论结果。此外,我们为对抗模仿学习应用定制了该算法的实现。在训练的每一步,中介智能体用生成的码扰动观测。由于这些中介码,所提算法在具有多种变化因素的环境中学习也高效。我们使用程序生成的博弈环境和合成数据来验证我们的断言。Github 实现可用。

关键词

引用

@article{arxiv.2002.06476,
  title  = {Follow the Neurally-Perturbed Leader for Adversarial Training},
  author = {Ari Azarafrooz},
  journal= {arXiv preprint arXiv:2002.06476},
  year   = {2020}
}