基于强化学习的元启发式算法中动态算子管理:用于排列流水线调度问题
机器学习
2024-08-28 v1
摘要
本研究基于强化学习开发了一套用于在元启发式算法中动态管理大型搜索算子组合的框架。该框架借鉴了禁忌搜索的思想,能够通过暂时排除效率较低的算子并在搜索过程中更新算子组合来实现持续适应。采用Q学习实现的自适应算子选择机制,可在动态更新后的算子组合中选择最合适的算子。与传统方法不同,本框架无需针对搜索算子提供专家输入,使领域内非专家用户也能有效使用该框架。通过将其应用于排列流水线调度问题,分析了本框架的性能。结果表明,本框架在最优间隙和收敛速度方面优于当前最先进的算法。
引用
@article{arxiv.2408.14864,
title = {Dynamic operator management in meta-heuristics using reinforcement learning: an application to permutation flowshop scheduling problems},
author = {Maryam Karimi Mamaghan and Mehrdad Mohammadi and Wout Dullaert and Daniele Vigo and Amir Pirayesh},
journal= {arXiv preprint arXiv:2408.14864},
year = {2024}
}