中文

LOVE:人工智能生成视频评估基准

计算机视觉与模式识别 2025-05-20 v1

摘要

最近的大型多模态模型(LMM)推动了文本到视频(T2V)生成和视频到文本(V2T)解释任务的显著进展。然而,当前的人工智能生成视频(AIGV)在感知质量和文本视频对齐方面仍存在局限。因此,迫切需要一种可靠且可扩展的AIGV评估方法,这在很大程度上依赖于人工标注的规模和质量。为此,我们提出AIGVE-60K,这是用于AI生成视频评估的全面数据集和基准,特点包括(i)全面的任务,涵盖20个细粒度任务维度的3050个详尽提示;(ii)最大的人工标注,包括12万条平均意见分数(MOS)和6万对问答(QA)对,标注于58500个由30个T2V模型生成的视频上;(iii)双向基准测试和评估,涵盖T2V生成和V2T解释能力。基于AIGVE-60K,我们提出LOVE,这是一种基于LMM的指标,用于多维度AIGV评估,包括感知偏好、文本视频对应关系以及实例层面和模型层面的任务特定准确性。全面实验表明,LOVE不仅在AIGVE-60K数据集上实现了最新性能,还能有效泛化到广泛的其他AIGV评估基准。这一发现凸显了AIGVE-60K数据集的重要性。数据库和代码已匿名方式提供于https://github.com/IntMeGroup/LOVE。

关键词

引用

@article{arxiv.2505.12098,
  title  = {LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation},
  author = {Jiarui Wang and Huiyu Duan and Ziheng Jia and Yu Zhao and Woo Yi Yang and Zicheng Zhang and Zijian Chen and Juntong Wang and Yuke Xing and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2505.12098},
  year   = {2025}
}