n 人可微博弈的力学
机器学习
2018-06-07 v2 计算机科学与博弈论
多智能体系统
神经与进化计算
摘要
支撑深度学习的基石是目标函数上梯度下降收敛至局部极小值的保证。遗憾的是,在诸如生成对抗网络这类存在多个相互作用损失项的设定中,该保证失效。基于梯度的方法在博弈中的行为尚不被充分理解——且随着对抗性与多目标架构的激增正变得愈发重要。本文中,我们开发新技术以理解并控制一般博弈中的动力学。关键结果是将二阶动力学分解为两个分量。其一是与势博弈相关的分量,可归约为隐式函数上的梯度下降;其二是与哈密顿博弈相关的分量,这是一类遵循守恒律的新博弈,类似于经典力学系统中的守恒定律。该分解催生了辛梯度调整(SGA),一种用于寻找一般博弈中稳定不动点的新算法。基础实验表明,SGA 在寻找 GAN 中稳定不动点方面与近期提出的算法具有竞争力——同时可应用于更一般的博弈且对其具有保证。
引用
@article{arxiv.1802.05642,
title = {The Mechanics of n-Player Differentiable Games},
author = {David Balduzzi and Sebastien Racaniere and James Martens and Jakob Foerster and Karl Tuyls and Thore Graepel},
journal= {arXiv preprint arXiv:1802.05642},
year = {2018}
}
备注
ICML 2018, final version