中文

基于混合数据集训练的通用人造视频质量评估

计算机视觉与模式识别 2021-02-11 v2 多媒体 图像与视频处理

摘要

视频质量评估(VQA)是计算机视觉中的一个重要问题。计算机视觉应用中的视频通常在自然场景下捕获。我们致力于自动评估自然场景下视频的质量,由于参考视频的缺失、失真的复杂性以及视频内容的多样性,这是一个具有挑战性的问题。此外,现有数据集间的视频内容与失真差异很大,导致数据驱动方法在跨数据集评测设定下性能不佳。为提升质量评估模型的性能,我们借鉴人类感知的直觉,具体而言,即人类视觉系统的内容依赖性与时间记忆效应。为应对跨数据集评测挑战,我们探索了一种混合数据集训练策略,以利用多个数据集训练单一的 VQA 模型。所提出的统一框架显式包含三个阶段:相对质量评估器、非线性映射和数据集特定的感知尺度对齐,以联合预测相对质量、感知质量与主观质量。实验在四个公开的自然场景 VQA 数据集上进行,即 LIVE-VQC、LIVE-Qualcomm、KoNViD-1k 和 CVD2014。实验结果验证了混合数据集训练策略的有效性,并证明了该统一模型相较于最先进模型的优越性能。为可复现研究,我们于 https://github.com/lidq92/MDTVSFA 提供了方法的 PyTorch 实现。

关键词

引用

@article{arxiv.2011.04263,
  title  = {Unified Quality Assessment of In-the-Wild Videos with Mixed Datasets Training},
  author = {Dingquan Li and Tingting Jiang and Ming Jiang},
  journal= {arXiv preprint arXiv:2011.04263},
  year   = {2021}
}

备注

20 pages, 12 figures, 7 tables, accepted by IJCV. This is the version provided to IJCV office