中文

ASAP:利用满足性泛化边来加强神经组合优化

机器学习 2026-01-30 v3 人工智能

摘要

深度强化学习(DRL)已成为解决组合优化(CO)问题(如 3D 箱包问题(3D-BPP)、旅行商问题(TSP)或车辆路径问题(VRP))的有前景的方法,但这些神经求解器在面对分布迁移时常表现脆弱。为此,我们揭示了满足性泛化边(Satisficing Generalization Edge),并对其进行理论和实验验证:识别一组有前景的动作,比选择单个最优动作更具通用性。为利用这一特性,我们提出了自适应提议后选择(Adaptive Selection After Proposal,ASAP)框架,将决策过程分解为两个 distinct 阶段:一个作为鲁棒过滤器的提议策略,以及一个作为可适应决策者的选择策略。这种体系结构使我们能够实现高度有效的在线适应策略,其中选择策略可在新分布上进行快速微调。具体而言,我们引入了一个通过模型无关的元学习(Model-Agnostic Meta-Learning,MAML)增强的两阶段训练框架,以为快速适应做好准备。针对 3D-BPP、TSP 和 CVRP进行大量实验,表明ASAP在提高基于最先进基线方法的泛化能力方面具有优势,并在分布外实例上实现卓越的在线适应。

关键词

引用

@article{arxiv.2501.17377,
  title  = {ASAP: Exploiting the Satisficing Generalization Edge in Neural Combinatorial Optimization},
  author = {Han Fang and Paul Weng and Yutong Ban},
  journal= {arXiv preprint arXiv:2501.17377},
  year   = {2026}
}