AutoCut:基于多模态离散化与可控生成的端到端广告视频编辑
计算机视觉与模式识别
2026-03-31 v1
摘要
短视频已成为数字广告的主要媒介,要求可扩展且高效的内容创作。然而,当前工作流程和AI工具仍然割裂且模态特定,导致生产成本高且整体效率低。为解决这一问题,我们提出了AutoCut——一个基于多模态离散化与可控编辑的端到端广告视频编辑框架。AutoCut采用专用编码器提取视频和音频特征,然后应用残差向量量化将它们离散化为与文本表示对齐的统一token,构建共享的视频-音频-文本token空间。基于基础模型,我们进一步开发了一个多模态大语言模型用于视频编辑,通过结合多模态对齐与监督微调来支持涵盖视频选择与排序、脚本生成和背景音乐选择等任务,在统一的编辑框架内完成。最后,一个完整的生产流水线将预测的token序列转换为可部署的长视频输出。在真实广告数据集上的实验表明,AutoCut降低了生产成本和迭代时间,同时显著提高了一致性和可控性,为可扩展的视频创作铺平了道路。
引用
@article{arxiv.2603.28366,
title = {AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation},
author = {Milton Zhou and Sizhong Qin and Yongzhi Li and Quan Chen and Peng Jiang},
journal= {arXiv preprint arXiv:2603.28366},
year = {2026}
}
备注
Accepted by CVPR 2026