中文

从文本到视频:高效剪辑序列生成

计算机视觉与模式识别 2023-11-21 v2

摘要

在网络上分享的大量视频中,剪辑精良的视频总能吸引更多关注。然而,缺乏经验的用户很难制作出剪辑精良的视频,因为这需要专业知识与大量人工劳动。为满足非专业用户的需求,我们提出 Transcript-to-Video——一种弱监督框架,以文本作为输入,从海量镜头集合中自动创建视频序列。具体而言,我们提出内容检索模块与时序连贯模块,分别用于学习视觉-语言表示与建模镜头排序风格。为实现快速推理,我们引入一种高效搜索策略以进行实时视频剪辑排序。定量结果与用户研究表明,所提学习框架能够检索内容相关镜头,同时生成风格上合理的视频序列。此外,运行性能分析显示我们的框架能够支持实际应用。

关键词

引用

@article{arxiv.2107.11851,
  title  = {Transcript to Video: Efficient Clip Sequencing from Texts},
  author = {Yu Xiong and Fabian Caba Heilbron and Dahua Lin},
  journal= {arXiv preprint arXiv:2107.11851},
  year   = {2023}
}

备注

Tech Report; Demo and project page at http://www.xiongyu.me/projects/transcript2video/