MVQA:用于高效视频质量评估的Mamba统一采样
计算机视觉与模式识别
2025-04-23 v1
摘要
长时段高清视频的快速增长使得高效视频质量评估(VQA)成为关键挑战。现有研究通常通过两种主要策略来解决此问题:降低模型参数或对输入进行重采样。然而,轻量级卷积神经网络(CNN)和Transformer往往难以在需要长程建模能力的前提下实现效率与高性能之间的平衡。最近,特别是Mamba等状态空间模型已成为有前景的替代方案,因其相对于序列长度为线性复杂度。与此同时,高效VQA高度依赖于对长序列进行重采样以最小化计算成本,但当前的重采样方法往往在保留关键语义信息方面有限。本文提出了MVQA,一种基于Mamba的VQA模型,以及一种新颖的统一语义与失真采样(USDS)方法。USDS结合了来自低分辨率视频的语义块采样和来自原始分辨率视频的失真块采样。前者捕获语义稠密区域,后者保留关键失真细节。为防止双输入导致计算增加,本文提出了使用预定义掩码的融合机制,实现无需额外计算负担的统一采样策略,既能捕获语义信息又能捕获质量信息。实验表明,配备USDS的所提出MVQA在实现最先进方法相当性能的同时,速度提升约为2倍,仅需约1/5的GPU内存。
引用
@article{arxiv.2504.16003,
title = {MVQA: Mamba with Unified Sampling for Efficient Video Quality Assessment},
author = {Yachun Mi and Yu Li and Weicheng Meng and Chaofeng Chen and Chen Hui and Shaohui Liu},
journal= {arXiv preprint arXiv:2504.16003},
year = {2025}
}