基于强化学习的非自回归旅行商问题求解器
人工智能
2024-10-17 v3
摘要
旅行商问题(TSP)是一个广为人知的组合优化问题,具有广泛的现实应用。近来,神经网络因文献所示能为TSP提供强启发式解而在此研究领域受到青睐。相较于自回归神经方法,非自回归(NAR)网络利用推理并行性提升推理速度,但解质量相对较低。本文提出一种名为NAR4TSP的新型NAR模型,其结合了专门设计的架构与增强的强化学习策略。据我们所知,NAR4TSP是首个成功结合RL与NAR网络的TSP求解器。关键在于将NAR网络输出解码纳入训练过程。NAR4TSP将TSP编码信息高效表示为奖励,并无缝集成到强化学习策略中,同时在训练与测试阶段保持一致的TSP序列约束。在合成与真实世界TSP上的实验结果表明,NAR4TSP在解质量、推理速度及向未知场景的泛化方面均优于五种最先进模型。
引用
@article{arxiv.2308.00560,
title = {Reinforcement Learning-based Non-Autoregressive Solver for Traveling Salesman Problems},
author = {Yubin Xiao and Di Wang and Boyang Li and Huanhuan Chen and Wei Pang and Xuan Wu and Hao Li and Dong Xu and Yanchun Liang and You Zhou},
journal= {arXiv preprint arXiv:2308.00560},
year = {2024}
}
备注
16 pages, 5 figures, and 9 tables. This work has been accepted by TNNLS