基于深度强化学习的旅行采购问题
最优化与控制
2025-07-03 v6 人工智能
机器学习
摘要
旅行采购问题(TPP)是一种具有广泛应用的重要组合优化问题。由于路由与采购之间的耦合,现有的TPP研究方法通常同时处理路由构建和采购计划,这导致_exact 方法计算成本高昂,而启发式方法设计复杂但性能有限。与此相反,我们提出了一种基于深度强化学习(DRL)的新方法,分别处理路由构建和采购计划,并从全局角度评估和优化解决方案。我们方法的关键组件包括用于捕获市场-产品关系的二分图表示,以及从二分图中提取信息并用于顺序构建路由的策略网络。我们框架的一个重要优势是能够高效地使用策略网络构建路由,一旦路由确定,即可通过线性规划轻松推导出相关的采购计划;同时,借助DRL,我们可以针对全局解决方案目标训练策略网络。此外,通过引入元学习策略,我们可以在大规模TPP实例上稳定训练策略网络,并在大小和分布不同的实例之间,甚至是训练期从未见过的更大实例上实现良好泛化。在各种合成TPP实例和TPPLIB基准上的实验表明,我们的DRL方法能够显著优于 established的TPP启发式方法,优化误差降低40%-90%,在大规模实例上运行时间也具有优势。
引用
@article{arxiv.2404.02476,
title = {Deep Reinforcement Learning for Traveling Purchaser Problems},
author = {Haofeng Yuan and Rongping Zhu and Wanlu Yang and Shiji Song and Keyou You and Wei Fan and C. L. Philip Chen},
journal= {arXiv preprint arXiv:2404.02476},
year = {2025}
}