中文

Score2Instruct:通过自动化维度评分扩展以视频质量为中心的指令

计算机视觉与模式识别 2026-03-30 v2

摘要

经典视频质量评估方法生成一个数值分数来评判视频的感知视觉保真度和清晰度。然而,分数无法描述视频复杂的质量维度,限制了其适用性。得益于人类友好的语言输出,通过指令微调将视频大型多模态模型适应于 VQA 有望解决这一问题。该方法的核心在于以视频质量为中心的指令数据。以往的探索主要集中在图像领域,其数据生成过程严重依赖人工质量标注和专有系统,限制了数据的可扩展性和有效性。为了应对这些挑战,我们提出了基于分数的指令生成流水线。具体而言,SIG 首先对未标注视频的多个质量维度进行评分,并将分数映射到文本定义的级别。然后,它显式地引入分层思维链来建模特定维度与整体质量之间的相关性,模拟人类视觉系统的推理过程。这一自动化流水线消除了对专家撰写的质量描述和专有系统的依赖,确保了数据的可扩展性和生成效率。为此,生成的 Score2Instruct 数据集包含超过 320K 个多样化的指令-响应对,为指令微调奠定了基础。此外,为了同时提升视频 LMM 的质量评分和论证能力,我们设计了一种渐进式微调策略,以充分释放 S2I 的潜力。在 SIG 的基础上,我们进一步构建了一个名为 S2I-Bench 的基准,包含 400 个开放式问题,以更好地评估视频 LMM 的质量论证能力。在 S2I-Bench 和现有基准上的实验结果表明,我们的方法持续提升了多个视频 LMM 的质量评分和论证能力。

关键词

引用

@article{arxiv.2506.21011,
  title  = {Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring},
  author = {Qizhi Xie and Kun Yuan and Yunpeng Qu and Jiachao Gong and Mingda Wu and Ming Sun and Chao Zhou and Jihong Zhu},
  journal= {arXiv preprint arXiv:2506.21011},
  year   = {2026}
}

备注

16 pages, 5 figures. Accepted by CVPR 2026 main conference