Text-to-Edit:基于多模态大语言模型的可控端到端视频广告创作
计算机视觉与模式识别
2025-01-13 v1
摘要
短视频内容的指数级增长引发了对高效、自动化视频编辑解决方案的需求激增,但需要理解视频并根据用户需求定制编辑带来了挑战。为满足这一需求,我们提出了一个创新的端到端基础框架,最终实现对最终视频内容编辑的精确控制。利用多模态大语言模型(MLLMs)的灵活性和泛化能力,我们定义了清晰的输入-输出映射以实现高效的视频创建。为了增强模型处理和理解视频内容的能力,我们引入了更密集帧率和慢-快处理技术的战略组合,显著增强了对视频时空信息的提取和理解。此外,我们引入了一种文本到编辑机制,允许用户通过文本输入实现所需的视频结果,从而提高了编辑视频的质量和可控性。通过全面的实验,我们的方法不仅在广告数据集中展示了显著的有效性,而且在公共数据集上得出了普遍适用的结论。
引用
@article{arxiv.2501.05884,
title = {Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs},
author = {Dabing Cheng and Haosen Zhan and Xingchen Zhao and Guisheng Liu and Zemin Li and Jinghui Xie and Zhao Song and Weiguo Feng and Bingyue Peng},
journal= {arXiv preprint arXiv:2501.05884},
year = {2025}
}
备注
16pages conference