通过深度强化学习进行加工网络控制
最优化与控制
2022-05-05 v1 人工智能
机器学习
摘要
新颖的高级策略梯度(APG)算法,如近端策略优化(PPO)、信赖域策略优化及其变体,因其易于实现和良好的实际性能已成为主导的强化学习(RL)算法。本学位论文关注于APG算法在求解加工网络控制优化问题中的理论依据与实际应用。加工网络控制问题通常被建模为马尔可夫决策过程(MDP)或半马尔可夫决策过程(SMDP),其具有若干RL中非常规的特征:无限状态空间、无界代价、长期平均代价目标。策略改进界在APG算法的理论依据中起着关键作用。在本文中,我们改进了现有有限状态空间MDP的界,并证明了用于建模加工网络运作的若干类MDP和SMDP的新策略改进界。我们考虑了两个加工网络控制问题的例子并定制PPO算法来求解。首先,我们考虑并行服务器和多类排队网络控制。其次,我们考虑网约车服务系统中的司机调度问题。对两个例子,带有辅助修改的PPO算法持续生成优于最先进启发式方法的控制策略。
引用
@article{arxiv.2205.02119,
title = {Processing Network Controls via Deep Reinforcement Learning},
author = {Mark Gluzman},
journal= {arXiv preprint arXiv:2205.02119},
year = {2022}
}
备注
PhD thesis