迈向更优的文本到视频生成评估指标
计算机视觉与模式识别
2024-01-17 v1
摘要
生成模型在合成高质量文本、图像和视频方面展现出卓越能力。在视频生成领域,当前的文本到视频模型表现出令人印象深刻的能力,能够制作视觉上惊艳的视频。然而,评估此类视频面临重大挑战。现有研究主要采用自动化指标,如 FVD、IS 和 CLIP Score。但这些指标提供的分析不完整,尤其是在视频内容的时序评估方面,因此使其成为真实视频质量的不可靠指标。此外,虽然用户研究有可能准确反映人类感知,但它们受限于耗时费力的特性,且结果常受主观偏见影响。在本文中,我们探究了现有指标的内在局限性,并引入一种新颖的评估流程——文本到视频评分(T2VScore)。该指标整合了两个关键标准:(1)文本-视频对齐度,审查视频在表示给定文本描述方面的忠实度;(2)视频质量,通过专家混合模型评估视频的整体制作水准。此外,为评估所提出的指标并促进其未来改进,我们呈现了 TVGE 数据集,该数据集收集了针对 2,543 个文本到视频生成视频在上述两个标准上的人类判断。在 TVGE 数据集上的实验证明了所提出的 T2VScore 在为文本到视频生成提供更优评估指标方面的优越性。
引用
@article{arxiv.2401.07781,
title = {Towards A Better Metric for Text-to-Video Generation},
author = {Jay Zhangjie Wu and Guian Fang and Haoning Wu and Xintao Wang and Yixiao Ge and Xiaodong Cun and David Junhao Zhang and Jia-Wei Liu and Yuchao Gu and Rui Zhao and Weisi Lin and Wynne Hsu and Ying Shan and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2401.07781},
year = {2024}
}
备注
Project page: https://showlab.github.io/T2VScore/