中文

DQ-Ladder:基于深度强化学习的自适应视频流媒体比特率梯度

图像与视频处理 2026-03-17 v1 多媒体

摘要

基于 HTTP 的分段视频自适应流通常依赖于预定义的比特率-分辨率配对集合,即比特率梯度。然而,固定梯度常常忽略内容及解码复杂度的差异,导致编码时间、解码效率和视频质量之间的最优权衡不足。本文介绍 DQ-Ladder,一种基于深度强化学习(DRL)的方案,用于为自适应视频流媒体应用构建时-质量感知的比特率梯度。DQ-Ladder 将预测的解码时间、质量评分以及每个分段的比特率水平作为深度 Q 网络(DQN)智能体的输入,依据解码时间、视频质量和分辨率平滑性的加权奖励函数进行指导。我们利用机器学习模型预测解码时间、比特率水平及客观质量指标(VMAF、XPSNR),从而消除对穷举编码或质量指标计算的需求。我们使用符合 Apple HLS 标准的 6 种分辨率和 41 个量化参数,在 750 个视频序列上对 DQ-Ladder 进行评估。实验结果表明,与四个基线方法相比,DQ-Ladder 对于 XPSNR 实现至少 10.3% 的 BD-rate 降低,同时将解码时间降低 22%。DQ-Ladder 对预测误差的敏感性显著低于竞争方法,即使存在高达 20% 的噪声仍能保持稳健性。

关键词

引用

@article{arxiv.2603.13597,
  title  = {DQ-Ladder: A Deep Reinforcement Learning-based Bitrate Ladder for Adaptive Video Streaming},
  author = {Reza Farahani and Zoha Azimi and Vignesh V Menon and Hermann Hellwagner and Radu Prodan and Schahram Dustdar and Christian Timmerer},
  journal= {arXiv preprint arXiv:2603.13597},
  year   = {2026}
}

备注

Adaptive Video Streaming, Deep Reinforcement Learning, Q-Learning, Bitrate Ladder, Quality Prediction