中文

基于多模态大语言模型的自动广告视频创建框架:VC-LLM

计算机视觉与模式识别 2025-04-09 v1

摘要

随着短视频的流行,视频内容在广告中的作用日益重要。通常,广告商会记录大量关于产品的原始影像,然后基于这些原始影像创建大量不同的短期广告视频。创建此类视频主要涉及编辑原始影像和撰写广告剧本,这需要一定的创造能力。通常很难为同一产品创建许多不同的视频内容,手动效率往往较低。本文提出了VC-LLM(Video Creation-LLM),一个由大型语言模型驱动的用于自动创建高质量短期广告视频的框架。我们的方法利用高分辨率的空间输入和低分辨率的时间输入来更有效地表示视频片段,既捕捉细粒度的视觉细节,又捕捉更广泛的时序动态。此外,在训练过程中,我们融合了通过改写ground truth文本生成的补充信息,确保所有关键输出信息都可直接追溯到输入,从而减少模型幻觉。我们还设计了一个用于评估创建视频质量的基准。实验表明,基于GPT-4o的VC-LLM能够生成与人类创建的视频相当的质量。 Furthermore,我们收集了大量高质量短期广告视频,以创建预训练数据集,并手动清理了部分数据以构建高质量的微调数据集。实验表明,在该基准上,基于微调LLM的VC-LLM能够生成在叙事逻辑方面优于基于GPT-4o的VC-LLM的视频。

关键词

引用

@article{arxiv.2504.05673,
  title  = {VC-LLM: Automated Advertisement Video Creation from Raw Footage using Multi-modal LLMs},
  author = {Dongjun Qian and Kai Su and Yiming Tan and Qishuai Diao and Xian Wu and Chang Liu and Bingyue Peng and Zehuan Yuan},
  journal= {arXiv preprint arXiv:2504.05673},
  year   = {2025}
}