AIGVE-MACS:用于 AI 生成视频评估的统一多方面评论与评分模型
计算机视觉与模式识别
2025-07-03 v1
摘要
AI 生成视频模型的快速发展催生了对鲁棒且可解释评估框架的迫切需求。现有指标仅生成数值分数,缺乏解释性评论,导致可解释性和人类评估对齐性较差。为此,我们引入 AIGVE-MACS,一个用于 AI 生成视频评估(AIGVE)的统一模型,它不仅能提供数值分数,还能提供多方面语言评论反馈来评估这些生成视频。我们核心方法是 AIGVE-BENCH 2,一个大型基准数据集,包含 2500 个 AI 生成视频和 22500 条人工标注的详细评论和分数,覆盖九个关键评估方面。借助 AIGVE-BENCH 2,AIGVE-MACS 融合最新的视觉语言模型,采用新颖的 token 级加权损失和动态帧采样策略,以更好地与人类评估者对齐。广泛的实验在监督和零样本基准测试中表明,AIGVE-MACS 在评分相关性和评论质量方面均实现了最先进的性能,显著优于包括 GPT-4o 和 VideoScore 在内的先前基线。此外,我们进一步展示了一个多智能体精炼框架,其中 AIGVE-MACS 提供的反馈驱动视频生成的迭代改进,导致 53.5% 的质量提升。本工作确立了一种全面、以人类为导向的 AI 生成视频评估新范式。我们将 AIGVE-BENCH 2 和 AIGVE-MACS 在 https://huggingface.co/xiaoliux/AIGVE-MACS 上发布。
引用
@article{arxiv.2507.01255,
title = {AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation},
author = {Xiao Liu and Jiawei Zhang},
journal= {arXiv preprint arXiv:2507.01255},
year = {2025}
}
备注
Working in Progress