Lotus:用于抽象式与抽取式摘要的长视频生成短视频系统
人机交互
2025-02-12 v1 计算机视觉与模式识别
摘要
短视频在抖音和 Instagram 等平台上广受欢迎,因为它们能迅速捕捉观众的注意力。许多创作者会将长视频改造为制作短视频,但创作者报告称,从长视频中规划、提取和排列片段的过程颇具挑战性。目前的做法要么是制作由现有长视频片段组成的抽取式短视频,要么是在视觉素材上添加新录制的旁白制作抽象式短视频。虽然抽取式视频保留了音视频之间的原始关联,但抽象式视频在内容选择上提供了在更短时间内包含内容的灵活性。我们提出的 Lotus 系统综合了上述两种方法,以平衡保留原始内容与内容灵活性。Lotus 首先通过生成短视频脚本及其对应的语音,创建抽象式短视频,然后将长视频片段匹配到生成的旁白中。随后,创作者可使用自动化方法或 Lotus 的编辑界面添加抽取式片段。Lotus 的界面可进一步细化短视频。我们将使用抽取基线方法生成的短视频与 Lotus 生成的短视频进行比较。在我们的用户研究中,我们比较了使用 Lotus 制作短视频与参与者现有实践之间的差异。
引用
@article{arxiv.2502.07096,
title = {Lotus: Creating Short Videos From Long Videos With Abstractive and Extractive Summarization},
author = {Aadit Barua and Karim Benharrak and Meng Chen and Mina Huh and Amy Pavel},
journal= {arXiv preprint arXiv:2502.07096},
year = {2025}
}
备注
15 pages, 9 figures, ACM IUI 2025