SLVMEval:用于文本到长视频生成的人工合成元评估基准
计算机视觉与模式识别
2026-04-01 v1 人工智能
摘要
本文提出了人工合成的长视频元评估基准SLVMEval,用于对文本到视频(T2V)评估系统进行元评估。该基准聚焦于评估这些系统在视频时长可达10,486秒(约3小时)的场景下的表现,尤其关注系统是否能够准确评估在人类评估容易的情景下的视频质量。我们采用基于两两比较的人工评估框架。基于密集视频-字幕数据集,我们对源视频进行人工合成退化,创建出在10个不同方面上具有“高质量与低质量”对比的受控样本。随后,我们利用众包方式筛选并保留仅有明显可感知退化的那些对,建立有效的最终测试基准。借助该测试基准,我们评估了现有评估系统在排序这些样本方面的可靠性。实验结果表明,人类评估者在辨别更优长视频时的准确率为84.7%至96.8%,且在九个十个方面中,这些系统的准确率均不及人类评估,揭示了文本到长视频评估中的不足。
引用
@article{arxiv.2603.29186,
title = {SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation},
author = {Ryosuke Matsuda and Keito Kudo and Haruto Yoshida and Nobuyuki Shimizu and Jun Suzuki},
journal= {arXiv preprint arXiv:2603.29186},
year = {2026}
}
备注
Accepted to CVPR 2026