面向组合优化问题的自博弈学习智能体
人工智能
2019-05-10 v2 机器学习
摘要
近期利用自博弈的强化学习(RL)进展在若干棋盘游戏(如国际象棋和围棋)以及视频游戏(如Atari游戏和Dota2)上展现了卓越性能。可以合理地认为,从零知识起步的RL在经过一定训练量后可能逐步逼近一种获胜策略。在本文中,我们探索神经蒙特卡洛树搜索(neural MCTS),这是一种由DeepMind成功应用于以超人类水平下围棋和国际象棋的RL算法。我们尝试借助neural MCTS的计算能力来解决一类组合优化问题。遵循Hintikka博弈论语义学的思想,我们提出Zermelo游戏化(ZG)将特定的组合优化问题转化为Zermelo博弈,其获胜策略对应于原优化问题的解。ZG还提供了一种专门设计的neural MCTS。我们使用一个其真实策略可高效计算的组合理规划问题来展示ZG的潜力。
引用
@article{arxiv.1903.03674,
title = {Learning Self-Game-Play Agents for Combinatorial Optimization Problems},
author = {Ruiyang Xu and Karl Lieberherr},
journal= {arXiv preprint arXiv:1903.03674},
year = {2019}
}
备注
Accepted as an Extended Abstract in AAMAS'19