用扩展 AlphaGo Zero 求解图上的 NP 难问题
机器学习
2020-03-10 v2 机器学习
摘要
利用机器学习求解组合优化问题面临日益增长的挑战。Khalil 等人提出了一种端到端强化学习框架 S2V-DQN,其自动学习图嵌入以构建广泛问题的解。为改进其 Q 学习方法的泛化能力,我们提出了一种基于 AlphaGo Zero 的新颖学习策略,AlphaGo Zero 是一个无需游戏领域知识即达到超人水平的围棋引擎。我们的框架针对组合问题重新设计,其中最终奖励可取任意实数而非胜/负的二元响应。在针对包括 {\sc MinimumVertexCover} 和 {\sc MaxCut} 在内的五类 NP 难问题的实验中,我们的方法被证明比 S2V-DQN 对各种图的泛化能力更好。此外,我们的方法可与近期发展的图神经网络(GNN)模型(如 \emph{Graph Isomorphism Network})结合,获得更佳性能。该实验还就每项任务合适的 GNN 模型选择给出了有趣见解。
引用
@article{arxiv.1905.11623,
title = {Solving NP-Hard Problems on Graphs with Extended AlphaGo Zero},
author = {Kenshin Abe and Zijian Xu and Issei Sato and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1905.11623},
year = {2020}
}