面向无参考视频质量评估的用户生成内容中并存失真捕捉
计算机视觉与模式识别
2023-08-01 v1
摘要
视频质量评估 (VQA) 旨在预测视频的感知质量,随着 Facebook、TikTok、Kwai 等流媒体技术的快速发展而受到日益增多的关注。与其他基于序列的视觉任务(例如动作识别)相比,VQA 在用户生成内容 (UGC) 视频中面临两个被低估且未解决的挑战。首先,包含严重失真(例如块效应、模糊)的若干帧决定整段视频的感知质量,这一现象并不罕见,而其他基于序列的任务需要更多同等重要的帧用于表征。其次,由于各种失真在持续时长与出现概率上的差异,视频的感知质量呈现多失真分布。为解决上述挑战,我们提出 Visual Quality Transformer (VQT) 以更高效提取质量相关的稀疏特征。在方法上,提出稀疏时间注意力 (STA) 通过分析帧间时间相关性采样关键帧,将计算复杂度从 降至 。在结构上,多路径时间网络 (MPTN) 并行利用多个具不同稀疏度的 STA 模块,捕捉视频中的并存失真。实验上,VQT 在三个公开无参考 VQA 数据集中表现优于许多 state-of-the-art 方法。此外,VQT 在四个全参考 VQA 数据集中相较广泛采用的工业算法(即 VMAF 与 AVQT)展现更优性能。
引用
@article{arxiv.2307.16813,
title = {Capturing Co-existing Distortions in User-Generated Content for No-reference Video Quality Assessment},
author = {Kun Yuan and Zishang Kong and Chuanchuan Zheng and Ming Sun and Xing Wen},
journal= {arXiv preprint arXiv:2307.16813},
year = {2023}
}
备注
10 pages, 7 figures, to appear in ACM MM 2023