中文

MVQA-68K:一个多维度且具有因果标注的视频评估数据集

计算机视觉与模式识别 2025-09-16 v1

摘要

随着 Sora 等视频生成模型的快速发展,视频质量评估(VQA)对于从大规模数据集中筛选高质量视频变得越来越重要。传统 VQA 方法通常产生单个数值分数,往往缺乏全面性和可解释性。为此,我们引入了 MVQA-68K,一个新型的多维度 VQA 数据集,包含超过 68,000 个仔细标注的视频,涵盖七个关键质量维度:整体审美、摄像机运动、动态程度、纹理细节、构图、视觉质量和事实一致性。每项标注都包括详细的链式思考推理,以促进可解释性和全面理解。大量实验表明,MVQA-68K 在 VQA 任务中显著提升了各种多模态大语言模型(MLLMs)的性能,不仅在内部测试集(图 1)上取得最佳结果,还在公共基准测试中包括 LSVQ-test、LSVQ-1080p 和 LIVE-VQC,实现了最先进的效果。同时,在 VQA 训练期间融入显式推理过程可显著提升零样本泛化能力。代码和数据集将在 github: https://github.com/Controller01-ai/MVQA-68K 上提供。

关键词

引用

@article{arxiv.2509.11589,
  title  = {MVQA-68K: A Multi-dimensional and Causally-annotated Dataset with Quality Interpretability for Video Assessment},
  author = {Yanyun Pu and Kehan Li and Zeyi Huang and Zhijie Zhong and Kaixiang Yang},
  journal= {arXiv preprint arXiv:2509.11589},
  year   = {2025}
}