中文

一种新型开关类型策略网络用于资源分配问题:技术报告

机器学习 2025-01-22 v1 系统与控制 系统与控制

摘要

深度强化学习(DRL)已成为开发队列网络控制策略的强大工具,但多层感知器(MLP)神经网络在这些应用中的常规使用存在显著缺点。MLP架构虽然灵活,却常常表现出较差的样本效率并倾向于过拟合训练环境,导致在新型未见网络上表现次佳。在此基础上,我们引入一种开关类型神经网络(STN)架构,以提高DRL策略在队列网络中的效率和泛化能力。STN利用传统非学习策略中的结构模式,确保在相似状态下选择一致的动作。该设计不仅简化了学习过程,也通过减少过拟合倾向性来促进更好的泛化。我们的工作提出了三个关键贡献:首先,发展STN作为MLP更有效的替代方案;其次,实证证明STN在various训练情景中实现了优越的样本效率;第三,实验结果表明STN在熟悉环境中与MLP性能相当,但在新环境中显著优于MLP。通过嵌入领域特定知识,STN在不损失性能的前提下提升了近端策略优化(PPO)算法的效果,表明其适用于广泛的队列网络控制问题。

关键词

引用

@article{arxiv.2501.11136,
  title  = {A Novel Switch-Type Policy Network for Resource Allocation Problems: Technical Report},
  author = {Jerrod Wigmore and Brooke Shrader and Eytan Modiano},
  journal= {arXiv preprint arXiv:2501.11136},
  year   = {2025}
}