基于层次强化学习的顺序随机组合优化
人工智能
2025-02-11 v1 机器学习
摘要
强化学习(RL)因其能够学习快速、有效且可泛化解决方案的特性,已成为组合优化(CO)问题的引人注目的工具。然而,现有工作大多聚焦于单次确定性 CO,而顺序随机组合优化(SSCO)鲜有探讨,尽管其广泛应用包括自适应影响最大化(IM)和传染病干预等。本文研究了 SSCO 问题,即我们首先决定在所有时间步骤上的预算(例如自适应 IM 中的种子节点数)分配,然后选择每个时间步骤的节点集合。少数既有研究通过假设在时间范围内均匀分配预算来简化问题,导致次优解。我们提出一种通用的层次 RL(HRL)框架,称为醒-睡选项(WS-option),这是一种双层选项方法,同时决定高层上自适应预算分配和低层的节点选择。WS-option 以两个层次马尔可夫决策过程(MDP)的协同表述开始,捕捉两个层次决策之间的相互依赖性。基于此,WS-option 采用几项创新设计来平衡模型训练稳定性和计算效率,防止两个层次之间的恶性循环干扰。实证结果表明,WS-option 在有效性和可泛化性方面显著优于传统方法。此外,所学模型可泛化到更大的图上,显著减少计算资源的开销。
引用
@article{arxiv.2502.05537,
title = {Sequential Stochastic Combinatorial Optimization Using Hierarchal Reinforcement Learning},
author = {Xinsong Feng and Zihan Yu and Yanhai Xiong and Haipeng Chen},
journal= {arXiv preprint arXiv:2502.05537},
year = {2025}
}