中文

基于重要性加权A3C的深度强化学习在视频传输服务中提升QoE

多媒体 2023-04-11 v1

摘要

自适应码率(ABR)算法用于根据网络状况调整视频码率,以改善整体视频体验质量(QoE)。近来,强化学习(RL)与异步优势 actor-critic(A3C)方法已被用于生成自适应码率算法,并且已表明相比固定规则 ABR 算法能改善整体 QoE。然而,A3C 方法的一个常见问题是行为策略与目标策略之间的滞后。结果,行为与目标策略不再同步,导致次优更新。在本工作中,我们提出 ALISA:一种带重要性采样的 actor-learner 架构,用于在 ABR 算法中高效学习。ALISA 引入重要性采样权重,对相关经验赋予更大权重,以解决现有 A3C 方法的滞后问题。我们给出了 ALISA 的设计与实现,并将其性能与最先进的视频码率自适应算法进行比较,包括 Pensieve 框架中实现的原生 A3C 以及其他固定规则调度器如 BB、BOLA 和 RB。我们的结果表明,ALISA 相比 Pensieve 平均 QoE 提高了高达 25%–48%,与固定规则调度器相比提升更甚。

关键词

引用

@article{arxiv.2304.04527,
  title  = {Deep Reinforcement Learning with Importance Weighted A3C for QoE enhancement in Video Delivery Services},
  author = {Mandan Naresh and Paresh Saxena and Manik Gupta},
  journal= {arXiv preprint arXiv:2304.04527},
  year   = {2023}
}

备注

Number of pages: 10, Number of figures: 9, Conference name: 24th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks (WoWMoM)