中文

FETV: 开放域文本到视频生成的细粒度评测基准

计算机视觉与模式识别 2023-12-27 v3

摘要

近来,开放域文本到视频(T2V)生成模型取得显著进展。然而,这些有前景的结果主要通过生成视频的定性案例展示,而 T2V 模型的定量评测仍面临两个关键问题。首先,现有研究缺乏对 T2V 模型在不同类别文本提示上的细粒度评测。尽管某些基准已对提示分类,但其分类或仅关注单一维度,或未能考虑视频生成中的时序信息。其次,自动评测指标是否与人类标准一致尚不清楚。为解决这些问题,我们提出 FETV,一个用于文本到视频生成的细粒度评测(Fine-grained Evaluation of Text-to-Video generation)基准。FETV 是多维度的,基于三个正交维度对提示分类:主要内容、待控制属性与提示复杂度。FETV 也是时序感知的,引入了若干专为视频生成定制的时序类别。基于 FETV,我们对四个代表性 T2V 模型进行了全面人工评测,揭示了它们在不同方面、不同提示类别上的优劣。我们还将 FETV 扩展为评测自动 T2V 指标可靠性的测试平台。FETV 的多维度分类实现了对不同场景下指标可靠性的细粒度分析。我们发现现有自动指标(如 CLIPScore 与 FVD)与人类评测相关性很差。为此,我们探索了改进 CLIPScore 与 FVD 的若干方案,并开发了两种比现有指标与人类相关性显著更高的自动指标。基准页面:https://github.com/llyx97/FETV。

关键词

引用

@article{arxiv.2311.01813,
  title  = {FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation},
  author = {Yuanxin Liu and Lei Li and Shuhuai Ren and Rundong Gao and Shicheng Li and Sishuo Chen and Xu Sun and Lu Hou},
  journal= {arXiv preprint arXiv:2311.01813},
  year   = {2023}
}

备注

NeurIPS 2023 Datasets and Benchmarks Track