中文

VGA-Bench:视频审美与生成质量评估的统一基准与多模型框架

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

AIGC驱动的视频生成快速发展,凸显了超越传统生成质量指标以涵盖审美吸引力的全面评估框架的紧迫需求。然而,现有基准主要关注技术保真度,留下了在整体性评估——特别是感知和艺术质量方面——的显著差距。为此,我们引入VGA-Bench,一个用于联合评估视频生成质量和审美质量的统一基准。VGA-Bench建立在原则性的三级分类法基础上:审美质量、审美标记和生成质量,每一级都分解为多个细粒度子维度,以实现系统化评估。 guided by this taxonomy,我们设计了1,016个多样化提示,并使用12个视频生成模型生成了规模为60,000多部的大型数据集,确保了在内容、风格和artifact方面的广泛覆盖。为实现可扩展和自动化评估,我们对数据集的子集进行了人工标注,并开发了三个专用的多任务神经评估器:VAQA-Net用于审美质量预测,VTag-Net用于自动审美标记,VGQA-Net用于生成和基本质量属性。大量实验表明,我们的模型实现了与人类判断的可靠对齐,提供了准确性和效率。我们将VGA-Bench作为公共基准发布,以促进AIGC评估研究,适用于内容 moderation、模型调试和生成模型优化。

关键词

引用

@article{arxiv.2604.10127,
  title  = {VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation},
  author = {Longteng Jiang and DanDan Zheng and Qianqian Qiao and Heng Huang and Huaye Wang and Yihang Bo and Bao Peng and Jingdong Chen and Jun Zhou and Xin Jin},
  journal= {arXiv preprint arXiv:2604.10127},
  year   = {2026}
}

备注

CVPR 2026