中文

近似可利用性:在大型博弈中学习最优响应

机器学习 2022-11-07 v5 机器学习

摘要

研究人员已经证明,神经网络容易受到对抗样本和细微环境变化的影响,这两者都可以被视为一种分布偏移。对人类来说,由此产生的错误看起来像是低级错误,从而削弱了对这些智能体的信任。在先前的博弈研究中,智能体评估通常侧重于实际博弈结果。虽然这很有价值,但此类评估通常无法评估对最坏情况结果的鲁棒性。先前在计算机扑克中的研究已经检查了如何精确和近似地评估这种最坏情况性能。不幸的是,在较大的领域中精确计算是不可行的,并且现有的近似依赖于扑克特定的知识。我们引入了 ISMCTS-BR,这是一种可扩展的基于搜索的深度强化学习算法,用于学习对智能体的最优响应,从而近似最坏情况性能。我们在几种双人零和博弈中针对各种智能体演示了该技术,包括几个基于 AlphaZero 的智能体。

关键词

引用

@article{arxiv.2004.09677,
  title  = {Approximate exploitability: Learning a best response in large games},
  author = {Finbarr Timbers and Nolan Bard and Edward Lockhart and Marc Lanctot and Martin Schmid and Neil Burch and Julian Schrittwieser and Thomas Hubert and Michael Bowling},
  journal= {arXiv preprint arXiv:2004.09677},
  year   = {2022}
}