MVFST-RL:一种用于带延迟动作的拥塞控制的异步强化学习框架
机器学习
2021-05-28 v4 分布式、并行与集群计算
网络与互联网体系结构
机器学习
摘要
有效的网络拥塞控制策略是维持互联网(或任何大型计算机网络)运行的关键。几十年来,网络拥塞控制一直由手工启发式方法主导。近来,强化学习(RL)作为自动优化此类控制策略的替代方案而出现。迄今的研究主要考虑在智能体思考下一步动作时会阻塞发送方的 RL 接口。这在很大程度上是基于为游戏 RL 设计的框架(如 OpenAI Gym)之上构建的产物。然而,这并不适用于真实网络环境,在网络环境中,网络发送方等待策略而不发送数据会导致带宽利用不足。我们转而提出用处理延迟动作的异步 RL 智能体来表述拥塞控制。我们提出 MVFST-RL,一个在 QUIC 传输协议中用于拥塞控制的可扩展框架,其利用了带离屏修正的异步 RL 训练前沿技术。我们分析了为缓解与马尔可夫动力学偏差的建模改进,并在 Pantheon 基准平台的仿真网络上评估了我们的方法。源代码公开于 https://github.com/facebookresearch/mvfst-rl。
引用
@article{arxiv.1910.04054,
title = {MVFST-RL: An Asynchronous RL Framework for Congestion Control with Delayed Actions},
author = {Viswanath Sivakumar and Olivier Delalleau and Tim Rocktäschel and Alexander H. Miller and Heinrich Küttler and Nantas Nardelli and Mike Rabbat and Joelle Pineau and Sebastian Riedel},
journal= {arXiv preprint arXiv:1910.04054},
year = {2021}
}
备注
Workshop on ML for Systems at NeurIPS 2019