ReLaX-VQA:用于提升视频质量评估的残差碎片和层堆叠提取
图像与视频处理
2025-03-14 v3 计算机视觉与模式识别
多媒体
摘要
随着在用户与共享平台之间交换的用户生成内容 (UGC) 的快速增长,野外视频质量评估的需求日益增长。UGC 通常使用消费级设备获取,并在到达最终用户之前经历多次压缩 (转码)。因此,传统的质量指标无法在没有对原始内容作为参考的情况下使用。本文提出了 ReLaX-VQA,一种新的无参考视频质量评估 (NR-VQA) 模型,旨在解决评估多样化视频内容质量的挑战,而无需参考原始未压缩视频。ReLaX-VQA 使用帧差选择智能地提取时空碎片,并结合所抽样帧的不同空间特征表达式。这些方法用于更好地捕捉相邻帧质量的空间和时间变异性。此外,该模型通过在残差网络和视觉转换器的深度神经网络特征中采用层堆叠技术来增强抽象化。广泛的在四个 UGC 数据集上的测试表明,ReLaX-VQA 在所有现有的 NR-VQA 方法之上都表现出色,平均 SRCC 为 0.8658,PLCC 为 0.8873。开源代码和训练好的模型可在 https://github.com/xinyiW915/ReLaX-VQA 上获取,以便进一步研究和应用。
引用
@article{arxiv.2407.11496,
title = {ReLaX-VQA: Residual Fragment and Layer Stack Extraction for Enhancing Video Quality Assessment},
author = {Xinyi Wang and Angeliki Katsenou and David Bull},
journal= {arXiv preprint arXiv:2407.11496},
year = {2025}
}
备注
10 pages, 3 figures