中文

基于 Swin TransformerV2 与由粗到精策略的视频质量评估

计算机视觉与模式识别 2024-01-17 v1 机器学习 图像与视频处理

摘要

无参考视频质量评估的目标是在无法访问参考高清视频的情况下评估失真视频的质量。在本研究中,我们引入了一个在多个图像质量评估数据集上预训练的增强型空间感知模块,以及一个轻量级时序融合模块,以解决无参考视觉质量评估(NR-VQA)任务。该模型采用 Swin Transformer V2 作为局部级空间特征提取器,并通过一系列 Transformer 层融合这些多阶段表示。此外,利用时序 Transformer 对整个视频进行时空特征融合。为适应不同比特率的压缩视频,我们融入了一种由粗到精的对比策略,以增强模型区分不同比特率视频特征的能力。本文是一页摘要的扩展版本。

关键词

引用

@article{arxiv.2401.08522,
  title  = {Video Quality Assessment Based on Swin TransformerV2 and Coarse to Fine Strategy},
  author = {Zihao Yu and Fengbin Guan and Yiting Lu and Xin Li and Zhibo Chen},
  journal= {arXiv preprint arXiv:2401.08522},
  year   = {2024}
}