中文

CelebV-Text:一个大规模人脸文本-视频数据集

计算机视觉与模式识别 2023-03-28 v1

摘要

文本驱动的生成模型在视频生成与编辑中蓬勃发展。然而,由于缺乏包含高质量视频与高度相关文本的合适数据集,以人脸为中心的文本到视频生成仍具挑战。本文提出 CelebV-Text,一个大规模、多样且高质量的人脸文本-视频对数据集,以促进人脸文本到视频生成任务的研究。CelebV-Text 包含 70,000 个具有多样视觉内容的真实场景人脸视频片段,每个片段均使用所提出的半自动文本生成策略配对 20 条文本。所提供的文本质量高,可精确描述静态与动态属性。通过对视频、文本及文本-视频相关性的全面统计分析,展示了 CelebV-Text 优于其他数据集。通过广泛的自评估进一步显示了 CelebV-Text 的有效性与潜力。我们构建了一个包含代表性方法的基准,以标准化人脸文本到视频生成任务的评估。所有数据与模型均已公开可用。

关键词

引用

@article{arxiv.2303.14717,
  title  = {CelebV-Text: A Large-Scale Facial Text-Video Dataset},
  author = {Jianhui Yu and Hao Zhu and Liming Jiang and Chen Change Loy and Weidong Cai and Wayne Wu},
  journal= {arXiv preprint arXiv:2303.14717},
  year   = {2023}
}

备注

Accepted by CVPR2023. Project Page: https://celebv-text.github.io/