中文

一种用于学习分支的改进强化学习算法

机器学习 2022-01-19 v1 人工智能 最优化与控制

摘要

大多数组合优化问题都可以表述为混合整数线性规划(MILP),其中分支定界(B&B)是一种通用且广泛使用的方法。近年来,学习分支(learning to branch)已成为机器学习与组合优化交叉领域的研究热点。本文提出了一种基于强化学习的新型 B&B 算法。类似于离线强化学习,我们最初在示范数据上进行训练以大幅加速学习。随着训练效果的改善,智能体开始逐步以其学到的策略与环境交互。通过确定示范数据与自生成数据之间的混合比例来提升算法性能至关重要。因此,我们提出了一种优先存储机制来自动调控该比例。为了提高训练过程的鲁棒性,在 Double DQN 的基础上额外引入了一个优越网络,该网络始终作为一个具有竞争性能的 Q 网络。我们在三个公开研究基准上评估了所提算法的性能,并与强基线进行了比较,包括三种经典启发式方法和一种最先进的基于模仿学习的分支算法。结果表明,所提算法在比较的算法中取得了最佳性能,并具备持续提升 B&B 算法性能的潜力。

关键词

引用

@article{arxiv.2201.06213,
  title  = {An Improved Reinforcement Learning Algorithm for Learning to Branch},
  author = {Qingyu Qu and Xijun Li and Yunfan Zhou and Jia Zeng and Mingxuan Yuan and Jie Wang and Jinhu Lv and Kexin Liu and Kun Mao},
  journal= {arXiv preprint arXiv:2201.06213},
  year   = {2022}
}