缩放与掩码:图像和视频质量评估的数据采样新范式
计算机视觉与模式识别
2024-01-08 v1 多媒体
摘要
图像和视频的质量评估既强调局部细节又强调全局语义,而通用的数据采样方法(例如调整大小、裁剪或基于网格的碎片化)无法同时捕捉这两者。为解决这一缺陷,当前方法不得不采用多分支模型并以多分辨率数据作为输入,这增加了模型复杂度。在这项工作中,我们没有堆叠模型,而是探索了一种更优雅的数据采样方法(命名为 SAMA,即缩放和掩码),该方法将局部和全局内容压缩到规则的输入尺寸中。其基本思想是首先将数据缩放为金字塔结构,然后通过掩码策略将金字塔缩减为规则的数据维度。受益于图像和视频中的空间和时间冗余,处理后的数据在保持多尺度特征的同时具有规则的输入尺寸,因此可以由单分支模型处理。我们在图像和视频质量评估中验证了该采样方法。实验表明,我们的采样方法可以显著提高当前单分支模型的性能,并在不增加额外模型复杂度的情况下达到与多分支模型相当的性能。源代码将在 https://github.com/Sissuire/SAMA 提供。
引用
@article{arxiv.2401.02614,
title = {Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment},
author = {Yongxu Liu and Yinghui Quan and Guoyao Xiao and Aobo Li and Jinjian Wu},
journal= {arXiv preprint arXiv:2401.02614},
year = {2024}
}
备注
Accepted by AAAI2024. Code has been released at https://github.com/Sissuire/SAMA