中文

具自动生成叙事的通用视频编辑框架——RACCooN

计算机视觉与模式识别 2025-10-06 v4 人工智能 计算与语言

摘要

最近的视频生成模型主要依赖仔细编写的文本提示来完成特定任务,如填充或风格编辑。它们需要大量的人工编写的文本描述作为输入视频,限制了其灵活性以适应个人/原始视频到用户规格。本文提出了 RACCooN,一个 versatile 且用户友好的 video-to-paragraph-to-video 生成框架,支持通过统一管道实现多种视频编辑功能,包括删除、添加和修改。RACCooN 由两个主要阶段组成:Video-to-Paragraph(V2P)和 Paragraph-to-Video(P2V)。在 V2P 阶段,我们自动以结构化的自然语言描述视频场景,捕获整体语境和聚焦对象细节。随后在 P2V 阶段,用户可可选性地细化这些描述以指导视频扩散模型,实现对输入视频的各种修改,如删除、更改主体和/或添加新对象。该方法与其他方法相比具有几个显著贡献:(1)RACCooN 提议一种多粒度时空池化策略,用于生成结构化视频描述,既捕获广泛语境又捕获对象细节,无需复杂的人类标注,简化了基于文本的精确视频内容编辑以供用户使用。(2)我们的视频生成模型融合了自动生成的叙事或指令,以提升生成内容的质量和准确性。(3)RACCooN 还计划在给定视频中想象新对象,以便用户只需输入提示即可获得复杂视频编辑的详细计划。该框架在视频到段落生成、视频内容编辑方面展现出强大的通用能力,并可整合到其他 SOTA 视频生成模型中以进一步提升。

关键词

引用

@article{arxiv.2405.18406,
  title  = {RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives},
  author = {Jaehong Yoon and Shoubin Yu and Mohit Bansal},
  journal= {arXiv preprint arXiv:2405.18406},
  year   = {2025}
}

备注

EMNLP 2025 main; The first two authors contribute equally. Project Page: https://raccoon-mllm-gen.github.io/