中文

TeViS:从文本梗概到视频故事板生成

计算机视觉与模式识别 2023-08-30 v4

摘要

视频故事板是视频创作的路线图,由逐镜图像组成,用于可视化文本梗概中的关键情节。然而,创建视频故事板仍然具有挑战性,不仅需要在高层文本与图像之间进行跨模态关联,还需要长期推理以使镜头间的过渡平滑。本文提出一项称为文本梗概到视频故事板(TeViS)的新任务,旨在检索一组有序图像序列作为视频故事板以可视化文本梗概。我们基于公开 MovieNet 数据集构建了 MovieNet-TeViS 数据集,包含 1 万条文本梗概,每条均配对有从相应电影中人工选取的关键帧,选取时同时考虑了相关性与电影连贯性。为对任务进行基准测试,我们给出了基于 CLIP 的强基线方法以及一种新颖的 VQ-Trans。VQ-Trans 首先将文本梗概与图像编码到联合嵌入空间,并使用向量量化(VQ)来改进视觉表示;随后自回归地生成视觉特征序列用于检索与排序。实验结果表明,VQ-Trans 显著优于先前方法与基于 CLIP 的基线。尽管如此,其与人类表现相比仍存在较大差距,表明未来仍有可观的研究空间。代码与数据见:\url{https://ruc-aimind.github.io/projects/TeViS/}

关键词

引用

@article{arxiv.2301.00135,
  title  = {TeViS:Translating Text Synopses to Video Storyboards},
  author = {Xu Gu and Yuchong Sun and Feiyue Ni and Shizhe Chen and Xihua Wang and Ruihua Song and Boyuan Li and Xiang Cao},
  journal= {arXiv preprint arXiv:2301.00135},
  year   = {2023}
}

备注

Accepted to ACM Multimedia 2023