中文

基于智能体的视频剪裁

计算机视觉与模式识别 2024-12-13 v1

摘要

随着信息获取的便利,用户生成视频的长度正在不断增加,这给观看者带来了巨大的负担,使其不得不筛选大量内容以获取有价值的信息。这一趋势凸显了需要一种高效提取关键视频信息的算法。尽管在突出显示检测、时刻检索和视频概述方面取得了显著进展,但当前方法主要集中于选择特定的时间区间,往往忽视了片段之间的相关性以及片段重排的潜在。本文提出一种新任务——视频剪裁 (Video Trimming, VT),其焦点在于检测无用画面、选择有价值的片段并将其组成一个连贯的叙事。为解决这一任务,我们提出了基于智能体的视频剪裁 (Agent-based Video Trimming, AVT),其结构分为三个阶段:视频结构化、片段过滤和叙事构成。具体而言,我们采用视频描述智能体将视频切片转换为结构化的文本描述,利用每个片段的结构化信息,动态过滤低质量画面的过滤模块,以及用于选择和编译有效片段以构建连贯最终叙事的视频安排智能体。为进行评估,我们开发了一个视频评估智能体来评估被剪裁后的视频,在人类评估的基础上进行并行评估。此外,我们收集了使用来自互联网的用户视频构建的新基准数据集。结果表明,AVT 在用户研究中的评估更有利,同时在 YouTube Highlights、TVSum 和我们自己的数据集上表现出在突出显示检测任务中的优异 mAP 和准确率。代码和模型已可在 https://ylingfeng.github.io/AVT 获取。

关键词

引用

@article{arxiv.2412.09513,
  title  = {Agent-based Video Trimming},
  author = {Lingfeng Yang and Zhenyuan Chen and Xiang Li and Peiyang Jia and Liangqu Long and Jian Yang},
  journal= {arXiv preprint arXiv:2412.09513},
  year   = {2024}
}