中文

使用基于时间预测的 FoV 自适应编码的交互式 $360^{\circ}$ 视频流

图像与视频处理 2024-03-19 v1 多媒体

摘要

对于 360360^{\circ} 视频流,FoV 自适应编码通过为预测的用户视场(FoV)分配更多比特,是在有限带宽下最大化渲染视频质量的有效方法。我们为交互式应用开发了一个低延迟的 FoV 自适应编码与流媒体系统,该系统对带宽变化和 FoV 预测误差具有鲁棒性。为了在最小化端到端延迟的同时最大化编码效率,我们提出了一种帧级 FoV 自适应帧间编码结构。在每一帧中,位于预测 FoV 内或附近的区域使用时间和空间预测进行编码,而一个小的旋转区域仅使用空间预测进行编码。该旋转帧内区域周期性地刷新整个帧,从而对 FoV 预测误差和由传输错误导致的帧丢失提供鲁棒性。该系统针对每个视频段调整不同区域的大小和速率,以在预测的带宽约束下最大化渲染视频质量。由于 FoV 的时间变化,将这种帧级 FoV 自适应与时间预测相结合具有挑战性。我们提出了对 FoV 动态如何影响时间预测编码的质量-速率性能进行建模的新方法。我们进一步开发了基于 LSTM 的机器学习模型来预测用户的 FoV 和网络带宽。所提出的系统与三个基准系统进行了比较,使用了真实世界的网络带宽轨迹和 FoV 轨迹,结果表明该系统显著提高了渲染视频质量,同时实现了非常低的端到端延迟和低帧冻结概率。

关键词

引用

@article{arxiv.2403.11155,
  title  = {Interactive $360^{\circ}$ Video Streaming Using FoV-Adaptive Coding with Temporal Prediction},
  author = {Yixiang Mao and Liyang Sun and Yong Liu and Yao Wang},
  journal= {arXiv preprint arXiv:2403.11155},
  year   = {2024}
}