中文

文本生成视频模型输出质量度量:指标与数据集

计算机视觉与模式识别 2023-09-18 v1 多媒体

摘要

评估文本生成视频(T2V)模型生成的视频质量十分重要,若要使这些模型产生看似合理、令观看者信服其真实性的输出。我们考察了该领域使用的一些指标并指出了其局限性。本文提出一个包含来自 5 个最新 T2V 模型的 1000 余段生成视频的数据集,并在其上应用了一些常用质量指标。我们还对这些视频进行了广泛的人类质量评估,从而得以比较各指标(包括人工评估)的相对优劣。我们的贡献在于对常用质量指标的评估,以及在一个开放的 T2V 视频数据集上对其性能与人类评估性能的比较。我们的结论是,自然度及与用于生成 T2V 输出的文本提示的语义匹配十分重要,但尚无单一度量能捕捉评估 T2V 模型输出时的这些细微差别。

关键词

引用

@article{arxiv.2309.08009,
  title  = {Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset},
  author = {Iya Chivileva and Philip Lynch and Tomas E. Ward and Alan F. Smeaton},
  journal= {arXiv preprint arXiv:2309.08009},
  year   = {2023}
}

备注

13 pages