通过弱到强学习实现可泛化的视频质量评估
计算机视觉与模式识别
2026-05-26 v5
摘要
视频质量评估(VQA)旨在预测视频的感知质量,使其与人类视觉感知对齐,是量化视频处理流程中质量退化的基础工具。主流的 VQA 范式依赖于使用人工标注数据集进行监督训练,尽管取得了显著进展,但在泛化到未见过的视频内容方面仍然表现不佳。在这项工作中,我们探索了弱到强(W2S)学习作为一种新范式,以在不依赖人工标注数据集的情况下推进 VQA。我们首先提供了经验证据,表明一种直接的 W2S 策略能让一个强大的学生模型不仅在域内基准上匹配其弱教师模型,而且在分布外(OOD)基准上超越它,揭示了 VQA 中独特的弱到强效应。基于这一洞察,我们提出了一个新颖的框架,从两个方面增强 W2S 学习:(1)通过一种学习排序的公式,整合来自多样化 VQA 教师(包括现成的 VQA 模型和合成失真模拟器)的同质和异质监督信号;(2)迭代 W2S 训练,每个强大的学生模型在后续循环中被回收作为教师,逐步聚焦于具有挑战性的案例。大量实验表明,我们的方法在域内和 OOD 基准上均取得了最先进的结果,尤其在 OOD 场景中增益显著。我们的发现突显了 W2S 学习是打破标注障碍并在视频质量评估中实现可扩展泛化的一条原则性路径。我们的数据和代码将在 https://github.com/clh124/W2S-VQA 上提供。
引用
@article{arxiv.2505.03631,
title = {Generalizable Video Quality Assessment via Weak-to-Strong Learning},
author = {Linhan Cao and Wei Sun and Xiangyang Zhu and Kaiwei Zhang and Jun Jia and Yicong Peng and Dandan Zhu and Guangtao Zhai and Xiongkuo Min},
journal= {arXiv preprint arXiv:2505.03631},
year = {2026}
}
备注
Accepted by CVPR 2026