中文

面向组合优化问题的自博弈学习智能体

人工智能 2019-05-10 v2 机器学习

摘要

近期利用自博弈的强化学习(RL)进展在若干棋盘游戏(如国际象棋和围棋)以及视频游戏(如Atari游戏和Dota2)上展现了卓越性能。可以合理地认为,从零知识起步的RL在经过一定训练量后可能逐步逼近一种获胜策略。在本文中,我们探索神经蒙特卡洛树搜索(neural MCTS),这是一种由DeepMind成功应用于以超人类水平下围棋和国际象棋的RL算法。我们尝试借助neural MCTS的计算能力来解决一类组合优化问题。遵循Hintikka博弈论语义学的思想,我们提出Zermelo游戏化(ZG)将特定的组合优化问题转化为Zermelo博弈,其获胜策略对应于原优化问题的解。ZG还提供了一种专门设计的neural MCTS。我们使用一个其真实策略可高效计算的组合理规划问题来展示ZG的潜力。

关键词

引用

@article{arxiv.1903.03674,
  title  = {Learning Self-Game-Play Agents for Combinatorial Optimization Problems},
  author = {Ruiyang Xu and Karl Lieberherr},
  journal= {arXiv preprint arXiv:1903.03674},
  year   = {2019}
}

备注

Accepted as an Extended Abstract in AAMAS'19