从文本到视频:高效剪辑序列生成
计算机视觉与模式识别
2023-11-21 v2
摘要
在网络上分享的大量视频中,剪辑精良的视频总能吸引更多关注。然而,缺乏经验的用户很难制作出剪辑精良的视频,因为这需要专业知识与大量人工劳动。为满足非专业用户的需求,我们提出 Transcript-to-Video——一种弱监督框架,以文本作为输入,从海量镜头集合中自动创建视频序列。具体而言,我们提出内容检索模块与时序连贯模块,分别用于学习视觉-语言表示与建模镜头排序风格。为实现快速推理,我们引入一种高效搜索策略以进行实时视频剪辑排序。定量结果与用户研究表明,所提学习框架能够检索内容相关镜头,同时生成风格上合理的视频序列。此外,运行性能分析显示我们的框架能够支持实际应用。
引用
@article{arxiv.2107.11851,
title = {Transcript to Video: Efficient Clip Sequencing from Texts},
author = {Yu Xiong and Fabian Caba Heilbron and Dahua Lin},
journal= {arXiv preprint arXiv:2107.11851},
year = {2023}
}
备注
Tech Report; Demo and project page at http://www.xiongyu.me/projects/transcript2video/