VCoME:带多模态编辑效果的口语视频构图
计算机视觉与模式识别
2024-07-08 v1 多媒体
摘要
口语视频包含旁白或文本叠加,提供了宝贵的内容,但在 incorporating 编辑效果以增强清晰度和视觉吸引力时 presents significant 挑战。本文引入了口语视频构图与编辑效果的新任务。该任务旨在通过整合文本、视觉和音频类别的多模态编辑效果,生成连贯且视觉上令人愉悦的口语视频。为实现这一目标,我们从公开来源收集了大型视频效果构图数据集。随后,我们将该任务表述为一个生成问题,涉及在口语内容中识别合适位置以及为这些位置推荐编辑效果。为解决这一任务,我们提出了 VCoME,一个通用框架,采用大型多模态模型为视频构图生成编辑效果。具体而言,VCoME 输入多模态视频上下文,自动生成在口语内容中应用效果的位置以及每个位置最合适的效果。VCoME还支持基于提示的构图密度和风格控制,为 diverse 应用 提供了 substantial 的灵活性。通过大量定量和定性评估,我们清晰地展示了 VCoME 的有效性。一个全面的用户研究显示,我们的方法在生成专业质量的视频方面效果显著,而且比专业编辑人员高效85倍。
引用
@article{arxiv.2407.04697,
title = {VCoME: Verbal Video Composition with Multimodal Editing Effects},
author = {Weibo Gong and Xiaojie Jin and Xin Li and Dongliang He and Xinglong Wu},
journal= {arXiv preprint arXiv:2407.04697},
year = {2024}
}