FAST-VQA:基于片段采样的高效端到端视频质量评估
计算机视觉与模式识别
2022-07-07 v1 多媒体
摘要
当前深度视频质量评估(VQA)方法在评估高分辨率视频时通常计算代价较高。该代价阻碍了它们通过端到端训练学习更好的视频质量相关表示。现有方法通常考虑朴素采样以降低计算成本,如缩放与裁剪。然而,它们明显破坏了视频中与质量相关的信息,因而对于学习良好的VQA表示并非最优。因此,迫切需要从头设计一种保留质量的VQA采样方案。本文中,我们提出网格微块采样(GMS),其通过以原始分辨率采样块来考虑局部质量,并通过均匀网格中采样的微块覆盖具有上下文关系的全局质量。这些微块被拼接并在时间上对齐,称为片段。我们进一步构建了专为以片段作为输入而设计的片段注意力网络(FANet)。由片段与FANet构成,所提出的用于VQA的片段采样Transformer(FrAgment Sample Transformer for VQA, FAST-VQA)实现了高效的端到端深度VQA并学习了有效的视频质量相关表示。它在1080P高分辨率视频上将最优精度提升约10\%,同时减少99.5\%的FLOPs。新学习的视频质量相关表示也可迁移至更小的VQA数据集,提升这些场景下的性能。大量实验表明FAST-VQA在不同分辨率输入下均具有良好性能且保持高效率。我们在https://github.com/timothyhtimothy/FAST-VQA发布了代码。
引用
@article{arxiv.2207.02595,
title = {FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment Sampling},
author = {Haoning Wu and Chaofeng Chen and Jingwen Hou and Liang Liao and Annan Wang and Wenxiu Sun and Qiong Yan and Weisi Lin},
journal= {arXiv preprint arXiv:2207.02595},
year = {2022}
}
备注
Will appear on ECCV 2022. 14 Pages