面向组合优化的多目标指针网络
机器学习
2022-04-27 v1 人工智能
摘要
多目标组合优化问题(MOCOPs)作为一类复杂优化问题广泛存在于各类实际应用中。尽管元启发式已成功用于求解 MOCOPs,但计算时间往往过长。近期,若干深度强化学习(DRL)方法被提出以生成组合优化问题的近似最优解。然而,现有 DRL 研究很少关注 MOCOPs。本研究提出一种单模型深度强化学习框架,称为多目标指针网络(MOPN),其中有效改进了 PN 的输入结构,使单一 PN 能够求解 MOCOPs。此外,提出基于代表模型与迁移学习的两种训练策略,以在不同应用场景中进一步提升 MOPN 性能。而且,与经典元启发式相比,MOPN 仅需在前向传播上消耗远更少时间即可获得帕累托前沿。同时,MOPN 对问题规模不敏感,意味着训练好的 MOPN 能处理不同规模的 MOCOPs。为验证 MOPN 性能,我们在三个多目标旅行商问题上与一种最先进模型 DRL-MOA 及三种经典多目标元启发式进行了大量实验。实验结果表明,所提模型以仅 DRL-MOA 20% 至 40% 的训练时间优于所有对比方法。
引用
@article{arxiv.2204.11860,
title = {Multi-objective Pointer Network for Combinatorial Optimization},
author = {Le-yang Gao and Rui Wang and Chuang Liu and Zhao-hong Jia},
journal= {arXiv preprint arXiv:2204.11860},
year = {2022}
}