结合 Q-Learning 的指针网络用于组合优化
机器学习
2024-10-25 v4 最优化与控制
摘要
我们提出了指针 Q 网络(PQN),一种将无模型 Q 值策略近似与指针网络(Ptr-Nets)相集成的混合神经架构,以增强基于注意力的序列生成的 optimality,并关注长期结果。该集成在解决组合优化(CO)任务中尤为有效,尤其是本文所关注的旅行商问题(TSP)。我们通过定义与 PQN 兼容的马尔可夫决策过程(MDP)来应对这一挑战,该过程涉及迭代图嵌入,以及基于 LSTM 的循环神经网络的编码与解码。此过程生成上下文向量并计算原始注意力分数,在应用 softmax 之前,这些分数由为所有可用状态-动作对计算的 Q 值进行动态调整。所得注意力向量被用作动作分布,动作的选择依赖于 PQN 的探索-利用动态适应性。我们的实证结果证明了该方法的有效性,并在不稳定环境中对模型进行了测试。
引用
@article{arxiv.2311.02629,
title = {Pointer Networks with Q-Learning for Combinatorial Optimization},
author = {Alessandro Barro},
journal= {arXiv preprint arXiv:2311.02629},
year = {2024}
}