中文

扩展感知视频质量评估的规模

计算机视觉与模式识别 2025-05-29 v1 人工智能

摘要

数据缩放定律已被证明能显著提升大型多模态模型 (LMMs) 在各种下游任务中的性能。然而,在感知视频质量评估 (VQA) 领域,由于标注资源的稀缺和数据集规模不足,缩放定律的潜力仍未被发掘。为了解决这一问题,我们提出了 \textbf{OmniVQA},这是一个旨在高效构建高质量、人在回路 VQA 多模态指令数据库 (MIDBs) 的高效框架。随后,我们进行规模扩展,创建了 \textbf{OmniVQA-Chat-400K},这是目前 VQA 领域最大的 MIDB。我们的关注点在于技术与美学质量维度,并提供了丰富的上下文指令数据以提供细粒度的 VQA 知识。此外,我们构建了 \textbf{OmniVQA-MOS-20K} 数据集,以增强模型的定量质量评分能力。随后,我们引入了一种 \textbf{互补} 训练策略,该策略有效地利用了数据集中的知识,用于质量理解和质量评分任务。此外,我们提出了 \textbf{OmniVQA-FG (fine-grain)-Benchmark},以评估模型的细粒度性能。我们的结果表明,我们的模型在质量理解和评分任务中均达到了 SOTA 性能。

关键词

引用

@article{arxiv.2505.22543,
  title  = {Scaling-up Perceptual Video Quality Assessment},
  author = {Ziheng Jia and Zicheng Zhang and Zeyu Zhang and Yingji Liang and Xiaorong Zhu and Chunyi Li and Jinliang Han and Haoning Wu and Bin Wang and Haoran Zhang and Guanyu Zhu and Qiyong Zhao and Xiaohong Liu and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2505.22543},
  year   = {2025}
}