Aurora:基于工具使用智能体的统一视频编辑
计算机视觉与模式识别
2026-05-19 v1
摘要
近期的视频编辑模型已收敛于一种统一的条件化设计:单个扩散 Transformer 同时处理文本、源视频和参考图像,并且一套权重涵盖替换、移除、风格迁移和参考驱动的插入。这种设计很灵活,但它假设用户已经为局部编辑提供了模型就绪的文本、参考图像和空间定位,而真实请求往往缺失这些内容。我们提出了 Aurora,这是一个智能体视频编辑框架,将一个工具增强的视觉语言模型(VLM)智能体与一个统一的视频扩散 Transformer 相结合。VLM 智能体将原始用户请求映射为与 Transformer 的条件通道对齐的结构化编辑计划,从而在生成之前解决文本和视觉的欠规约问题。我们使用用于完整编辑计划和参考图像选择的监督数据,以及用于稳健工具使用和指令优化的偏好对来训练 VLM 智能体。我们引入了 AgentEdit-Bench,以在文本和视觉欠规约下评估智能体增强的视频编辑。在 AgentEdit-Bench 和两个现有视频编辑基准上的实验表明,Aurora 优于仅使用指令的基线,并且 VLM 智能体可迁移至兼容的冻结视频编辑模型。项目页面:https://yeates.github.io/Aurora-Page
引用
@article{arxiv.2605.18748,
title = {Aurora: Unified Video Editing with a Tool-Using Agent},
author = {Yongsheng Yu and Ziyun Zeng and Zhiyuan Xiao and Zhenghong Zhou and Hang Hua and Wei Xiong and Jiebo Luo},
journal= {arXiv preprint arXiv:2605.18748},
year = {2026}
}
备注
Code: https://github.com/yeates/Aurora