Reframe Anything:用于开放世界视频重 framing 的大语言模型智能体
计算机视觉与模式识别
2024-03-12 v1 人机交互
摘要
移动设备和社交媒体的普及彻底改变了内容传播,短视频变得越来越普遍。这一转变带来了视频重 framing(reframing)的挑战,即调整视频以适应各种屏幕宽高比,该过程需突出视频中最引人注目的部分。传统上,视频重 framing 是一项手动、耗时且需要专业知识任务,导致高昂的制作成本。一种潜在的解决方案是采用一些机器学习模型,如视频显著目标检测,来自动化该过程。然而,这些方法往往因依赖特定的训练数据而缺乏泛化能力。强大大型语言模型(LLM)的出现为人工智能能力开辟了新途径。在此基础上,我们推出了 Reframe Any Video Agent (RAVA),这是一种基于 LLM 的智能体,它利用视觉基础模型和人类指令来重构视觉内容以进行视频重 framing。RAVA 分为三个阶段:感知阶段,解释用户指令和视频内容;规划阶段,确定宽高比和重 framing 策略;执行阶段,调用编辑工具生成最终视频。我们的实验验证了 RAVA 在视频显著目标检测和现实世界重 framing 任务中的有效性,展示了其作为 AI 驱动视频编辑工具的潜力。
引用
@article{arxiv.2403.06070,
title = {Reframe Anything: LLM Agent for Open World Video Reframing},
author = {Jiawang Cao and Yongliang Wu and Weiheng Chi and Wenbo Zhu and Ziyue Su and Jay Wu},
journal= {arXiv preprint arXiv:2403.06070},
year = {2024}
}
备注
14 pages, 6 figures