DisCoVQA:用于视频质量评估的时间失真-内容Transformer
计算机视觉与模式识别
2022-06-22 v1 多媒体
摘要
帧之间的时间关系及其对视频质量评估(VQA)的影响在现有工作中仍研究不足。这些关系给视频质量带来两类重要影响。首先,一些时间变化(如抖动、闪烁和突兀的场景切换)会造成时间失真并导致额外的质量退化,而其他变化(例如与有意义事件相关的变化)则不会。其次,人类视觉系统通常对不同内容的帧具有不同注意力,导致它们对整体视频质量的重要性不同。基于Transformer突出的时间序列建模能力,我们提出了一种新颖有效的基于Transformer的VQA方法来应对这两个问题。为了更好地区分时间变化从而捕捉时间失真,我们设计了基于Transformer的时空失真提取(STDE)模块。为处理时间质量注意力,我们提出了类编码器-解码器的时间内容Transformer(TCT)。我们还对特征引入时间采样以缩短TCT的输入长度,从而提升该模块的学习有效性和效率。由STDE和TCT构成的所提时间失真-内容Transformer视频质量评估方法(DisCoVQA)在多个VQA基准上达到了最先进(SOTA)性能,无需任何额外预训练数据集,且比现有方法的泛化能力强至多10%。我们还进行了大量消融实验以证明所提模型各部分的的有效性,并提供可视化证明所提模块实现了我们对这些时间问题建模的意图。我们将于稍后发布代码和预训练权重。
引用
@article{arxiv.2206.09853,
title = {DisCoVQA: Temporal Distortion-Content Transformers for Video Quality Assessment},
author = {Haoning Wu and Chaofeng Chen and Liang Liao and Jingwen Hou and Wenxiu Sun and Qiong Yan and Weisi Lin},
journal= {arXiv preprint arXiv:2206.09853},
year = {2022}
}