中文

从长视频到精彩片段:一种受人类启发的多模态叙事理解视频编辑框架

计算机视觉与模式识别 2025-10-06 v2 计算与语言

摘要

在线视频内容的快速增长,尤其是在短视频平台上,催生了对高效视频编辑技术的日益增长的需求,这些技术能够将长视频压缩成简洁且引人入胜的片段。现有的自动编辑方法主要依赖于来自ASR转录文本的文本线索和端到端的片段选择,常常忽略了丰富的视觉上下文,导致输出不连贯。在本文中,我们提出了一种受人类启发的自动视频编辑框架(HIVE),该框架利用多模态叙事理解来解决这些局限性。我们的方法通过多模态大语言模型整合了角色提取、对话分析和叙事摘要,从而能够全面理解视频内容。为了进一步增强连贯性,我们应用了场景级分割,并将编辑过程分解为三个子任务:高光检测、开头/结尾选择以及无关内容的修剪。为了促进该领域的研究,我们引入了DramaAD,这是一个新颖的基准数据集,包含800多个短剧集和500个专业编辑的广告片段。实验结果表明,我们的框架在通用和面向广告的编辑任务上均持续优于现有基线,显著缩小了自动编辑视频与人工编辑视频之间的质量差距。

关键词

引用

@article{arxiv.2507.02790,
  title  = {From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding},
  author = {Xiangfeng Wang and Xiao Li and Yadong Wei and Xueyu Song and Yang Song and Xiaoqiang Xia and Fangrui Zeng and Zaiyi Chen and Liu Liu and Gu Xu and Tong Xu},
  journal= {arXiv preprint arXiv:2507.02790},
  year   = {2025}
}

备注

Accepted by EMNLP 2025 Industry Track