VQ-Insight:通过渐进式视觉强化学习教会视觉语言模型进行 AI 生成视频质量理解
计算机视觉与模式识别
2025-06-24 v1
摘要
最新进展在人工智能生成内容 (AIGC) 推动了强大文本到视频生成模型的涌现。尽管如此,评估 AIGC 生成视频的质量仍具有挑战性,原因在于泛化能力有限、缺乏时序感知、对大规模标注数据集的依赖过重,以及与生成模型的有效交互不足。目前大多数方法依赖于视觉语言模型 (VLM) 的监督式微调,往往需要大规模标注数据集且倾向于分离理解与生成。为此,我们提出 VQ-Insight,这是一种用于 AIGC 视频质量评估的新型推理式 VLM 框架。我们的方案特点包括:(1) 结合图像质量热身、通用任务特定时序学习以及与视频生成模型联合优化的渐进式视频质量学习方案;(2) 设计多维度评分奖励、偏好比较奖励和时序建模奖励,以增强视频质量评估中的泛化与专业性。广泛实验表明,VQ-Insight 在偏好比较、多维度评分和自然视频评分方面均一致优于最先进的基线方法,为视频生成任务带来了显著改进。
引用
@article{arxiv.2506.18564,
title = {VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning},
author = {Xuanyu Zhang and Weiqi Li and Shijie Zhao and Junlin Li and Li Zhang and Jian Zhang},
journal= {arXiv preprint arXiv:2506.18564},
year = {2025}
}
备注
Technical Report