通过 Lower-Layer 信息暴露与在线调优提升神经自适应无线视频流媒体
多媒体
2025-01-03 v1
摘要
深度强化学习 (DRL) 在自适应视频流媒体领域展现出巨大的潜力,近日受到广泛关注。然而,现有的 DRL 基于自适应视频流媒体的方法仅使用应用 (APP) 层信息,采用启发式训练方法,并使用预收集数据训练通用神经网络。本文旨在通过使用下层信息、建立严谨的训练方法以及采用基于实时数据的在线调优,提升自适应无线视频流媒体的用户体验 (QoE)。首先,本文将过去的下层信息纳入,构建更为全面和准确的自适应无线视频流媒体问题建模为一个折扣马尔可夫决策过程 (MDP)问题,以实现 QoE 与获取系统信息成本之间的灵活权衡。在离线场景(仅使用预收集数据),本文提出一种增强型异步优势演员-评论家 (eA3C) 方法,通过联合优化参数化策略和价值函数的参数来实现。具体而言,本文构建一个包含策略网络和价值网络的 eA3C 网络,后者能够利用跨层、过去和当前信息,并使用预收集样本联合训练 eA3C 网络。在在线场景(使用额外的实时数据),本文提出两种基于持续学习的在线调优方法,用于为特定用户设计不同的 QoE 和训练时间权衡下的更优策略。最终,实验结果表明,所提出的离线策略在离线场景下的 QoE 较当前所述方法提升 6.8~14.4%;在在线场景下,所提出的在线策略相对于所提出的离线策略可进一步实现 6~28% 的 QoE 提升。
引用
@article{arxiv.2501.01044,
title = {Enhancing Neural Adaptive Wireless Video Streaming via Lower-Layer Information Exposure and Online Tuning},
author = {Lingzhi Zhao and Ying Cui and Yuhang Jia and Yunfei Zhang and Klara Nahrstedt},
journal= {arXiv preprint arXiv:2501.01044},
year = {2025}
}
备注
technical report for IEEE TMM, 17 pages, 10 figures