VQAThinker:基于强化学习探索通用且可解释的视频质量评估
计算机视觉与模式识别
2026-02-03 v2
摘要
视频质量评估(VQA)旨在客观量化人类视觉感知对感知质量退化的感知。尽管近期取得的进展,但现有VQA模型仍面临两个关键局限性:对分布外(OOD)视频的泛化性差,以及可解释性有限,这限制了其在实际场景中的应用。为此,我们提出VQAThinker,一个基于推理的VQA框架,利用大型多模态模型(LMM)结合强化学习,联合建模视频质量理解与评分,模拟人类感知决策。具体而言,我们采用组相对策略优化(GRPO),这是一种受规则指导的强化学习算法,使其能在评分层面的监督下进行视频质量推理,并引入三个VQA专用奖励:(1) bell 曲线回归奖励——随预测误差减小而快速增大,并在接近真实值时变得 progressively 不够敏感;(2) 两两排序奖励——引导模型正确确定视频对之间的相对质量;(3) 时序一致性奖励——鼓励模型优先选择其扰动后版本的时序连贯视频。广泛实验表明,VQAThinker 在两个域内和 OOD VQA基准测试中实现了最先进性能,显示出强大的视频质量评分泛化能力。此外,对视频质量理解任务的评估表明,其在失真归因和质量描述方面优于现有可解释VQA模型和 LMM。这些发现表明,强化学习为仅凭评分层面的监督构建通用且可解释的VQA模型提供了有效路径。
引用
@article{arxiv.2508.06051,
title = {VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning},
author = {Linhan Cao and Wei Sun and Weixia Zhang and Xiangyang Zhu and Jun Jia and Kaiwei Zhang and Dandan Zhu and Guangtao Zhai and Xiongkuo Min},
journal= {arXiv preprint arXiv:2508.06051},
year = {2026}
}
备注
Accepted by AAAI2026