中文

基于对比学习的视频质量评估—联合视频视觉变换器用于视频识别

计算机视觉与模式识别 2026-03-12 v1

摘要

视频质量显著影响视频分类。我们在从清晰视频中良好分类轻度认知障碍,但从模糊视频中效果较差时发现了这一问题。随后,我们意识到参考视频质量评估(VQA)可能可以改进视频分类。本文提出了基于自监督学习的视频视觉变换器结合无参考VQA用于视频分类的SSL-V3(Self-Supervised Learning-based Video Vision Transformer)方法。SSL-V3利用组合SSL机制将VQA融入视频分类中,以解决VQA标签短缺的问题,这在视频数据集中常见,导致无法提供准确的视频质量评分。简而言之,组合SSL将视频质量评分作为因素,直接调节视频分类的特征图。该评分作为交叉点,将VQA与分类链接,并利用监督分类任务调节VQA的参数。SSL-V3在两个数据集上实现了稳健的实验结果。例如,在I-CONECT(一个涉及面部视频的数据集)中的一些访谈视频上达到了94.87%的准确率,验证了SSL-V3的有效性。

关键词

引用

@article{arxiv.2603.10965,
  title  = {Contrastive learning-based video quality assessment-jointed video vision transformer for video recognition},
  author = {Jian Sun and Mohammad H. Mahoor},
  journal= {arXiv preprint arXiv:2603.10965},
  year   = {2026}
}

备注

9 figures, 10 tables,