中文

从画面到叙事:基于统一语言表示的LLM辅助视频编辑

计算机视觉与模式识别 2025-05-20 v1

摘要

大语言模型(LLMs)与视觉语言模型(VLMs)在视频理解中展现出卓越的推理与泛化能力,但在视频编辑领域的应用仍鲜有探索。本文首次系统性研究LLMs在视频编辑中的作用。为弥合视觉信息与语言推理之间的鸿沟,本文引入L-Storyboard作为中间表示,将离散视频画面转化为结构化语言描述,适用于LLM处理。我们将视频编辑任务划分为收敛型任务与发散型任务,聚焦三项核心任务:画面属性分类、下一画面选择与画面序列排序。为解决发散型任务输出固有的不稳定性,本文提出StoryFlow策略,将多路径推理过程转化为收敛式选择机制,显著提升任务准确率与逻辑一致性。实验结果表明,L-Storyboard实现了视觉信息与语言描述之间的更稳健的映射,显著增强了视频编辑任务的可解释性与隐私保护。此外,StoryFlow在画面序列排序中提升了逻辑一致性与输出稳定性,凸显LLMs在智能视频编辑中的巨大潜力。

关键词

引用

@article{arxiv.2505.12237,
  title  = {From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations},
  author = {Yuzhi Li and Haojun Xu and Feng Tian},
  journal= {arXiv preprint arXiv:2505.12237},
  year   = {2025}
}