中文

Q-Save: 面向生成视频评估的评分与归因

计算机视觉与模式识别 2026-03-02 v2

摘要

评估 AI 生成视频 (AIGV) 的质量依赖三个关键维度:视觉质量、动态质量和文本-视频对齐。虽然已提出诸多评估数据集和算法,但现有方法受限于两个局限:缺乏对评估维度的系统性定义,以及将三个维度在独立模型中处理。因此,我们引入 Q-Save,一个用于 AIGV 质量评估的整体基准数据集和统一评估模型。Q-Save 数据集包含近 1 万个视频样本,每个样本标注有 Mean Opinion Scores (MOS) 以及跨三个核心维度的细粒度归因解释。借助该归因标注数据集,我们训练了提出的 Q-Save 模型,采用 SlowFast 框架平衡准确率与效率,采用三阶段训练策略搭配 Chain-of-Thought (COT) 格式数据:监督微调 (SFT)、Grouped Relative Policy Optimization (GRPO) 以及最终的 SFT 轮次,以联合完成质量评分和归因生成。实验结果表明,Q-Save 在 AIGV 质量预测中实现卓越性能,同时提供可解释的依据。代码和数据集将在论文发表后公开。

关键词

引用

@article{arxiv.2511.18825,
  title  = {Q-Save: Towards Scoring and Attribution for Generated Video Evaluation},
  author = {Xiele Wu and Zicheng Zhang and Mingtao Chen and Yixian Liu and Yiming Liu and Shushi Wang and Zhichao Hu and Yuhong Liu and Guangtao Zhai and Xiaohong Liu},
  journal= {arXiv preprint arXiv:2511.18825},
  year   = {2026}
}

备注

20 pages, 11 figures