基于强化学习的自动视频编辑方法:利用预训练视觉语言模型
计算机视觉与模式识别
2024-11-08 v1
摘要
在当今视频时代,自动视频编辑技术因能减少工作负担和降低对人类编辑师的要求而受到产业界和学术界的广泛关注。现有自动化编辑系统主要局限于特定场景或事件,例如足球赛转播,而针对通用编辑(如电影或 vlog 编辑),这些编辑涉及多样化的场景和事件,却鲜少有研究。将事件驱动的编辑方法转化为通用场景则非线性难题。本文提出了一种两阶段通用编辑方案。首先,不同于以往提取场景特定特征的方法,我们利用预训练视觉语言模型(Vision-Language Model, VLM)提取与编辑相关的表征作为编辑上下文。此外,为弥合专业风格视频与仅依赖简单指导规则生成的自动化产出之间的差距,我们提出了一种基于强化学习(Reinforcement Learning, RL)的编辑框架,以形式化编辑问题并训练虚拟编辑器以作出更优的顺序编辑决策。最后,我们在更通用的编辑任务上进行了评估,采用真实电影数据集。实验结果表明,所提出的上下文表征以及RL驱动的编辑框架的学习能力在实际应用中有效且具有益处。
引用
@article{arxiv.2411.04942,
title = {A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model},
author = {Panwen Hu and Nan Xiao and Feifei Li and Yongquan Chen and Rui Huang},
journal= {arXiv preprint arXiv:2411.04942},
year = {2024}
}