StarVQA+: 用于视频质量评估的时空注意力协同训练
计算机视觉与模式识别
2023-06-22 v1 机器学习
图像与视频处理
摘要
基于自注意力的 Transformer 已在许多计算机视觉任务中取得巨大成功。然而,其在视频质量评估(VQA)中的应用迄今尚不令人满意。由于原始参考和拍摄失真的未知性,评估真实场景(in-the-wild)视频的质量具有挑战性。本文提出一种针对 VQA 问题的协同训练时空注意力网络,称为 StarVQA+。具体而言,我们首先通过交替拼接分割的时空注意力来构建 StarVQA+。然后,为促进 StarVQA+ 的训练,我们通过将平均意见得分(MOS)编码为概率向量并嵌入一个特殊 token 作为 MOS 的可学习变量,设计了一种向量化回归损失,从而更好地拟合人类评分过程。最后,为解决 Transformer 的数据饥渴问题,我们提出利用图像和视频协同训练空间与时间注意力权重。我们在事实上的真实场景视频数据集上进行了多种实验,包括 LIVE-Qualcomm、LIVE-VQC、KoNViD-1k、YouTube-UGC、LSVQ、LSVQ-1080p 和 DVL2021。实验结果表明,所提出的 StarVQA+ 优于当前最先进水平(state-of-the-art)。
引用
@article{arxiv.2306.12298,
title = {StarVQA+: Co-training Space-Time Attention for Video Quality Assessment},
author = {Fengchuang Xing and Yuan-Gen Wang and Weixuan Tang and Guopu Zhu and Sam Kwong},
journal= {arXiv preprint arXiv:2306.12298},
year = {2023}
}