中文

基于 LSTM 的视频会议通话中考虑时序失真的视频质量预测

图像与视频处理 2023-03-23 v1 机器学习

摘要

当前最先进的视频质量模型(如 VMAF)通过将退化视频与其参考视频比较给出了优异的预测结果。然而,它们未考虑视频会议通话中发生的时序失真(例如帧冻结或跳帧)。在本文中,我们提出一种数据驱动方法,通过训练一个由众包标注主观质量评分的 LSTM 来自动建模此类失真。视频采集自 83 种不同网络条件下的实时视频会议通话。我们在源视频上应用 QR 码作为标记以创建对齐的参考,并基于对齐向量计算时序特征。将这些特征与 VMAF 核心特征结合使用,我们提出的模型在验证集上达到了 0.99 的 PCC。此外,我们的模型输出逐帧质量,从而详细揭示视频质量损伤的原因。VCM 模型和数据集已在 https://github.com/microsoft/Video_Call_MOS 开源。

关键词

引用

@article{arxiv.2303.12761,
  title  = {LSTM-based Video Quality Prediction Accounting for Temporal Distortions in Videoconferencing Calls},
  author = {Gabriel Mittag and Babak Naderi and Vishak Gopal and Ross Cutler},
  journal= {arXiv preprint arXiv:2303.12761},
  year   = {2023}
}

备注

Accepted at ICASSP 2023