中文

MRET:用于视频质量评估的多分辨率 Transformer

计算机视觉与模式识别 2023-03-31 v2

摘要

面向用户生成内容(UGC)的无参考视频质量评估(NR-VQA)对于理解和提升视觉体验至关重要。与视频识别任务不同,VQA 任务对输入分辨率的变化敏感。由于如今大量 UGC 视频为 720p 或以上,传统 NR-VQA 方法所用固定且相对较小的输入导致许多视频丢失高频细节。本文提出一种新颖的基于 Transformer 的 NR-VQA 框架,可保留高分辨率质量信息。借助多分辨率输入表示与一种新颖的多分辨率块采样机制,我们的方法能全面观测全局视频构成与局部高分辨率细节。所提方法可有效聚合时空维度上不同粒度下的质量信息,使模型对输入分辨率变化具有鲁棒性。我们的方法在大规模 UGC VQA 数据集 LSVQ 与 LSVQ-1080p 上取得最先进性能,并在 KoNViD-1k 与 LIVE-VQC 上无需微调即达此性能。

关键词

引用

@article{arxiv.2303.07489,
  title  = {MRET: Multi-resolution Transformer for Video Quality Assessment},
  author = {Junjie Ke and Tianhao Zhang and Yilin Wang and Peyman Milanfar and Feng Yang},
  journal= {arXiv preprint arXiv:2303.07489},
  year   = {2023}
}

备注

Frontiers Signal Processing in Computational Video and Video Streaming (https://www.frontiersin.org/articles/10.3389/frsip.2023.1137006/full)