中文

排序奖励:使组合优化的自博弈强化学习成为可能

机器学习 2018-12-10 v3 人工智能 机器学习

摘要

在双人游戏中,对抗性自博弈与结合深度神经网络和树搜索的强化学习算法结合时取得了令人印象深刻的成果。诸如 AlphaZero 与 Expert Iteration 等算法从零开始学习,动态产生信息量极高的训练数据。然而,自博弈训练策略不能直接应用于单人游戏。近来,若干具有实际重要性的组合优化问题,如旅行商问题与装箱问题,已被重构为强化学习问题,这使得在双人游戏之外启用自博弈优势变得更为重要。我们提出排序奖励(R2)算法,通过对单个智能体在多局游戏中获得的奖励进行排序以创建相对性能指标,从而实现上述目标。将 R2 算法应用于二维与三维装箱问题实例的结果表明,其优于通用蒙特卡洛树搜索、启发式算法与整数规划求解器。我们还对排序奖励机制进行了分析,特别是不同难度问题实例与不同排序阈值的影响。

关键词

引用

@article{arxiv.1807.01672,
  title  = {Ranked Reward: Enabling Self-Play Reinforcement Learning for Combinatorial Optimization},
  author = {Alexandre Laterre and Yunguan Fu and Mohamed Khalil Jabri and Alain-Sam Cohen and David Kas and Karl Hajjar and Torbjorn S. Dahl and Amine Kerkeni and Karim Beguir},
  journal= {arXiv preprint arXiv:1807.01672},
  year   = {2018}
}