T2VEval:面向文本到视频生成视频的基准数据集与客观评估方法
计算机视觉与模式识别
2026-01-27 v7
摘要
近期的文本到视频 (T2V) 技术进步,如 Runway Gen-3、Pika、Sora 和 Kling,显著拓宽了其应用范围和流行度。这一进步催生了对 T2V 生成视频感知质量的准确评估指标的日益增长的需求,以优化视频生成模型。然而,由于存在高度复杂的失真,如不自然的动作和现象违背人类认知,评估文本到视频输出质量仍然具有挑战性。为此,我们构建了 T2VEval-Bench,用于文本到视频质量评估的多维基准数据集,其中包含 148 个文本提示和 1,783 个由 13 个 T2V 模型生成的视频。为确保全面评估,我们在主观实验中对每个视频在四个维度上进行评分,这些维度分别是整体印象、文本-视频一致性、真实性和技术质量。基于 T2VEval-Bench,我们开发了 T2VEval,一种用于 T2V 质量评估的多分支融合方案。T2VEval 在三个分支上评估视频:文本-视频一致性、真实性和技术质量。通过注意力机制融合模块,T2VEval 有效地整合来自各分支的特征,并辅助大型语言模型预测评分。此外,我们实施了一种分而治之训练策略,使每个分支能够学习针对性知识,同时保持与其他分支的协同。实验结果表明,T2VEval 在多个指标上实现了最佳性能。
引用
@article{arxiv.2501.08545,
title = {T2VEval: Benchmark Dataset and Objective Evaluation Method for T2V-generated Videos},
author = {Zelu Qi and Ping Shi and Shuqi Wang and Chaoyang Zhang and Fei Zhao and Zefeng Ying and Da Pan and Xi Yang and Zheqi He and Teng Dai},
journal= {arXiv preprint arXiv:2501.08545},
year = {2026}
}
备注
This paper has been accepted by DISPLAYS