BQ-NCO:用于高效神经组合优化的互模拟商化方法
机器学习
2023-10-02 v3 最优化与控制
摘要
尽管基于神经网络的端到端启发式学习组合优化方法取得了成功,分布外泛化仍是一项挑战。本文提出一种将组合优化问题(COPs)表述为马尔可夫决策过程(MDPs)的新形式,其有效利用了COPs的共性对称以提升分布外鲁棒性。从构造性方法的直接MDP表述出发,我们引入一种基于MDP中互模拟商化(BQ)的通用状态空间约简方法。随后,针对具有递归性质的COPs,我们特化该互模拟并展示约简状态如何利用这些问题的对称性并便于MDP求解。我们的方法具有原理性,并证明所提BQ-MDP的最优策略确实能求解相应COPs。我们在五个经典问题上阐释该方法:欧氏与非对称旅行商问题、带容量约束车辆路径问题、定向问题和背包问题。此外,针对每个问题,我们为BQ-MDP引入一个简单的基于注意力的策略网络,并通过模仿单一分布下小实例的(近)最优解进行训练。我们在合成与真实基准上对五个COPs均取得新的最先进结果。值得注意的是,与多数现有神经方法不同,我们学到的策略对远大于训练时所见规模的实例展现出优异的泛化性能,且无需任何额外搜索过程。
引用
@article{arxiv.2301.03313,
title = {BQ-NCO: Bisimulation Quotienting for Efficient Neural Combinatorial Optimization},
author = {Darko Drakulic and Sofia Michel and Florian Mai and Arnaud Sors and Jean-Marc Andreoli},
journal= {arXiv preprint arXiv:2301.03313},
year = {2023}
}