我们在玩什么博弈?范式与扩展式博弈中的端到端学习
机器学习
2018-06-29 v2 计算机科学与博弈论
多智能体系统
机器学习
摘要
尽管近期 AI 研究在求解大型、零和、扩展式博弈方面取得重大进展,但多数过往工作的潜在假设是博弈本身的参数被智能体所知。本文处理相对未被充分探索但同样重要的“逆”设定,即底层博弈的参数并非所有智能体已知,而必须通过观测来学习。我们提出一个可微的端到端学习框架来解决该任务。具体地,我们考虑博弈的正则化版本,等价于一种特定形式的量化响应均衡,并发展 1)用于在范式与扩展式博弈中寻找此类均衡点的原始-对偶牛顿法;以及 2)一种反向传播方法,使我们能通过对解本身解析计算所有相关博弈参数的梯度。这最终让我们以端到端方式训练来学习博弈, effectively 通过将“可微博弈求解器”集成到更大深度网络架构的循环中。我们在包括扑克与安全博弈任务的数个设定中展示了该学习方法的有效性。
引用
@article{arxiv.1805.02777,
title = {What game are we playing? End-to-end learning in normal and extensive form games},
author = {Chun Kai Ling and Fei Fang and J. Zico Kolter},
journal= {arXiv preprint arXiv:1805.02777},
year = {2018}
}
备注
Fixed typos and updated experimental results