Zoom-VQA:面向视频质量评估的补丁、帧与片段融合方法
计算机视觉与模式识别
2023-04-14 v1
摘要
视频质量评估(VQA)旨在模拟人类对视频质量的感知,其受从低层颜色与纹理细节到高层语义内容等因素的影响。为有效建模这些复杂的质量相关因素,本文中将视频分解为三个层级(即补丁级、帧级和片段级),并提出一种新颖的Zoom-VQA架构以感知不同层级的时空特征。它集成了三个组件:补丁注意力模块、帧金字塔对齐和片段集成策略,分别用于捕获空间维度上的感兴趣区域、不同特征层级的多层信息,以及分布在时间维度上的失真。得益于全面的设计,Zoom-VQA在四个VQA基准上取得了最先进的结果,并在NTIRE 2023 VQA挑战赛中获得第二名。值得注意的是,Zoom-VQA在LSVQ的两个子集上超越了先前最佳结果,在相应子集上分别达到0.8860(+1.0%)和0.7985(+1.9%)的SRCC。充分的消融实验进一步验证了各组件的有效性。代码和模型发布于https://github.com/k-zha14/Zoom-VQA。
引用
@article{arxiv.2304.06440,
title = {Zoom-VQA: Patches, Frames and Clips Integration for Video Quality Assessment},
author = {Kai Zhao and Kun Yuan and Ming Sun and Xing Wen},
journal= {arXiv preprint arXiv:2304.06440},
year = {2023}
}
备注
Accepted by CVPR 2023 Workshop