DIRECT: 通过分层多智能体规划与意图引导编辑实现视频混剪创作
计算机视觉与模式识别
2026-04-07 v1 人工智能
多媒体
摘要
视频混剪创作代表一种复杂的视频编辑范式,它通过重组现有素材来打造引人入胜的音视体验,要求在语义、视觉和听觉维度及多个层次上进行复杂的编排。然而,现有的自动编辑框架往往忽视跨层次的多模态编排以实现专业级的流畅性,导致序列不连贯、视觉过渡突兀以及音乐错位。为解决这一问题,我们将视频混剪创作形式化为多模态连贯性满足问题(Multimodal Coherency Satisfaction Problem, MMCSP),并提出了 DIRECT 框架。模拟专业制作流程,我们的分层多智能体框架将挑战分解为三个级联层次:Screenwriter 负责基于源素材的全局结构锚定,Director 负责实例化自适应编辑意图与引导,Editor 负责意图引导的镜头序列编辑与精细优化。我们进一步引入了 Mashup-Bench,一个包含视觉连贯性和听觉对齐定制指标的综合性基准。大量实验表明,DIRECT 在客观指标和人工主观评估两方面均显著优于现有最先进基线。项目页面和代码:https://github.com/AK-DREAM/DIRECT
引用
@article{arxiv.2604.04875,
title = {DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing},
author = {Ke Li and Maoliang Li and Jialiang Chen and Jiayu Chen and Zihao Zheng and Shaoqi Wang and Xiang Chen},
journal= {arXiv preprint arXiv:2604.04875},
year = {2026}
}