文本生成视频模型输出质量度量:指标与数据集
计算机视觉与模式识别
2023-09-18 v1 多媒体
摘要
评估文本生成视频(T2V)模型生成的视频质量十分重要,若要使这些模型产生看似合理、令观看者信服其真实性的输出。我们考察了该领域使用的一些指标并指出了其局限性。本文提出一个包含来自 5 个最新 T2V 模型的 1000 余段生成视频的数据集,并在其上应用了一些常用质量指标。我们还对这些视频进行了广泛的人类质量评估,从而得以比较各指标(包括人工评估)的相对优劣。我们的贡献在于对常用质量指标的评估,以及在一个开放的 T2V 视频数据集上对其性能与人类评估性能的比较。我们的结论是,自然度及与用于生成 T2V 输出的文本提示的语义匹配十分重要,但尚无单一度量能捕捉评估 T2V 模型输出时的这些细微差别。
引用
@article{arxiv.2309.08009,
title = {Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset},
author = {Iya Chivileva and Philip Lynch and Tomas E. Ward and Alan F. Smeaton},
journal= {arXiv preprint arXiv:2309.08009},
year = {2023}
}
备注
13 pages