深度强化学习能解决 Erdos-Selfridge-Spencer 博弈吗?
人工智能
2018-07-02 v5 神经与进化计算
机器学习
摘要
深度强化学习已取得诸多近期成功,但我们对其实力与局限的理解受制于缺乏可充分刻画最优行为的丰富环境,并相应地针对此类刻画诊断单个动作。此处我们考虑一类组合博弈,源自 Erdos、Selfridge 和 Spencer 的工作,并提议将其用作评估和比较不同强化学习方法的环境。这些博弈具有若干吸引人的特性:它们对当前学习方法具有挑战性,但构成 (i) 低维、简单参数化的环境,其中 (ii) 从任意状态出发的最优行为存在线性闭式解,且 (iii) 博弈难度可通过以可解释方式改变环境参数来调节。我们利用这些 Erdos-Selfridge-Spencer 博弈不仅比较不同算法,还测试泛化能力、与监督学习进行比较、分析多智能体博弈,甚至开发了一种自博弈算法。代码见:https://github.com/rubai5/ESS_Game
引用
@article{arxiv.1711.02301,
title = {Can Deep Reinforcement Learning Solve Erdos-Selfridge-Spencer Games?},
author = {Maithra Raghu and Alex Irpan and Jacob Andreas and Robert Kleinberg and Quoc V. Le and Jon Kleinberg},
journal= {arXiv preprint arXiv:1711.02301},
year = {2018}
}
备注
Accepted to ICML 2018, code opensourced at: https://github.com/rubai5/ESS_Game