StarVQA:用于视频质量评估的时空注意力网络
计算机视觉与模式识别
2021-08-24 v1
摘要
注意力机制如今在计算机视觉中蓬勃发展。然而,其在视频质量评估(VQA)中的应用尚未见报道。由于原始参考和拍摄失真的未知性,评估真实场景视频的质量具有挑战性。本文提出一种用于 VQA 问题的时空注意力网络,命名为 StarVQA。StarVQA 通过交替拼接分割的时空注意力构建 Transformer。为适配 Transformer 架构进行训练,StarVQA 通过将平均意见得分(MOS)编码为概率向量并嵌入一个特殊的向量化标签 token 作为可学习变量,设计了向量化回归损失。为捕获视频序列的长程时空依赖,StarVQA 将每个图像块的时空位置信息编码到 Transformer 的输入中。我们在事实上的真实场景视频数据集上进行了多种实验,包括 LIVE-VQC、KoNViD-1k、LSVQ 和 LSVQ-1080p。实验结果证明了所提 StarVQA 相对于当前最优方法的优越性。代码与模型将发布于:https://github.com/DVL/StarVQA。
引用
@article{arxiv.2108.09635,
title = {StarVQA: Space-Time Attention for Video Quality Assessment},
author = {Fengchuang Xing and Yuan-Gen Wang and Hanpin Wang and Leida Li and Guopu Zhu},
journal= {arXiv preprint arXiv:2108.09635},
year = {2021}
}