中文

缩放与掩码:图像和视频质量评估的数据采样新范式

计算机视觉与模式识别 2024-01-08 v1 多媒体

摘要

图像和视频的质量评估既强调局部细节又强调全局语义,而通用的数据采样方法(例如调整大小、裁剪或基于网格的碎片化)无法同时捕捉这两者。为解决这一缺陷,当前方法不得不采用多分支模型并以多分辨率数据作为输入,这增加了模型复杂度。在这项工作中,我们没有堆叠模型,而是探索了一种更优雅的数据采样方法(命名为 SAMA,即缩放和掩码),该方法将局部和全局内容压缩到规则的输入尺寸中。其基本思想是首先将数据缩放为金字塔结构,然后通过掩码策略将金字塔缩减为规则的数据维度。受益于图像和视频中的空间和时间冗余,处理后的数据在保持多尺度特征的同时具有规则的输入尺寸,因此可以由单分支模型处理。我们在图像和视频质量评估中验证了该采样方法。实验表明,我们的采样方法可以显著提高当前单分支模型的性能,并在不增加额外模型复杂度的情况下达到与多分支模型相当的性能。源代码将在 https://github.com/Sissuire/SAMA 提供。

关键词

引用

@article{arxiv.2401.02614,
  title  = {Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment},
  author = {Yongxu Liu and Yinghui Quan and Guoyao Xiao and Aobo Li and Jinjian Wu},
  journal= {arXiv preprint arXiv:2401.02614},
  year   = {2024}
}

备注

Accepted by AAAI2024. Code has been released at https://github.com/Sissuire/SAMA