中文

学习用于整数规划的大邻域搜索策略

人工智能 2021-11-08 v1 机器学习 最优化与控制

摘要

我们提出一种深度强化学习(RL)方法来学习用于整数规划(IP)的大邻域搜索(LNS)策略。该RL策略被训练为破坏算子,在每一步选择变量子集,并由IP求解器作为修复算子重新优化。然而,变量子集的组合数量阻碍了典型RL算法的直接应用。为应对此挑战,我们将所有子集表示为对每个变量上二元决策的因子分解。随后我们设计神经网络并行学习每个变量的策略,并通过定制的 actor-critic 算法训练。我们在四个代表性IP问题上评估所提方法。结果表明,它能在更短时间内找到比SCIP更好的解,并在相同运行时间内显著优于其他LNS基线。此外,当策略泛化到更大问题时,这些优势依然显著存在。与Gurobi的进一步实验也揭示,在相同时间限制内我们的方法可以优于这一最先进商业求解器。

关键词

引用

@article{arxiv.2111.03466,
  title  = {Learning Large Neighborhood Search Policy for Integer Programming},
  author = {Yaoxin Wu and Wen Song and Zhiguang Cao and Jie Zhang},
  journal= {arXiv preprint arXiv:2111.03466},
  year   = {2021}
}

备注

18 pages, 4 figure