中文

Plume:一种基于优先轨迹采样的高性能深度强化学习网络控制器框架

机器学习 2023-11-14 v2 网络与互联网体系结构

摘要

深度强化学习(DRL)已在多种网络环境中展现出潜力。然而,这些环境给标准 DRL 技术带来了若干根本性挑战:它们难以探索,且表现出高度的噪声与不确定性。尽管这些挑战使训练过程复杂化,我们发现实践中可通过解决一个此前被忽视的因素——DRL 训练数据集中偏斜的输入轨迹分布——来大幅缓解其影响,甚至取得最先进的真实世界性能。我们提出了一个通用框架 Plume,通过三阶段流程自动识别并平衡该偏斜:首先,识别决定轨迹行为的关键特征;其次,将轨迹分类为簇;最后,对显著簇进行优先级排序以提升控制器的整体性能。Plume 可无缝适用于各类 DRL 算法,无需对 DRL 工作流做任何改动。我们在三种网络环境(包括自适应码率流、拥塞控制与负载均衡)上评估了 Plume。在不同控制器与 DRL 算法下,Plume 在仿真与真实环境中均提供优越性能。例如,我们用 Plume 训练的新型 ABR 控制器 Gelato 在直播平台 Puffer 上持续超过一年优于此前最先进的控制器,是该平台上首个在视频质量与卡顿方面均带来统计显著改进的控制器,将卡顿降低多达 75%。

关键词

引用

@article{arxiv.2302.12403,
  title  = {Plume: A Framework for High Performance Deep RL Network Controllers via Prioritized Trace Sampling},
  author = {Sagar Patel and Junyang Zhang and Sangeetha Abdu Jyothi and Nina Narodytska},
  journal= {arXiv preprint arXiv:2302.12403},
  year   = {2023}
}