中文

Fair-Aurora:多流环境中基于强化学习的拥塞控制公平性策略比较

网络与互联网体系结构 2026-05-20 v1

摘要

强化学习(RL)已成为互联网拥塞控制的一种有前景的范式,能实现比传统启发式算法更高的链路利用率。然而,在单流环境中训练的基于RL的控制器,部署到多流网络时并不能保证公平地共享带宽。本文研究了Aurora(一种最先进的深度RL拥塞控制器)的公平性特性,并评估了三种保留Aurora RL架构的事后公平性策略:奖励塑形(策略A)、观测增强(策略B)和损失敏感度调优(策略C)。通过使用一个定制的共享瓶颈模拟器,并以Jain公平性指数作为主要度量指标,我们发现适度的奖励塑形在保持总吞吐量的同时实现了最佳的公平性。所有策略都维持了总带宽预算,公平性是通过重新分配而非减少来实现的。除了2流同构设置外,在Aurora与CUBIC混合竞争以及动态流加入/退出场景下的扩展评估表明,策略C的损失敏感度成为最符合TCP友好性的机制,而策略B在动态流集合变化中最为稳定。

关键词

引用

@article{arxiv.2605.19909,
  title  = {Fair-Aurora: Comparing Fairness Strategies for Reinforcement Learning-Based Congestion Control in Multi-Flow Environments},
  author = {Thomas Mbrice and Yuyu Liu},
  journal= {arXiv preprint arXiv:2605.19909},
  year   = {2026}
}