面向开源下一代通用视频智能体的UniVA
计算机视觉与模式识别
2025-11-12 v1
摘要
虽然专用AI模型在诸如生成或理解等孤立视频任务中表现出色,但实际应用需求的是复杂的、迭代的工作流程,这些工作流程综合了这些能力。为填补这一差距,我们引入UniVA——一个开源的、全能的、面向下一代通用视频智能体的多智能体框架,将视频理解、分割、编辑和生成统一为连贯的工作流程。UniVA采用Plan-and-Act双智能体架构驱动高度自动化和主动的工作流程:规划智能体解释用户意图并将其分解为结构化的视频处理步骤,而执行智能体则通过基于MCP的模块化工具服务器(用于分析、生成、编辑、跟踪等)来执行这些步骤。通过层次化的多级记忆(全局知识、任务上下文和用户特定偏好),UniVA能够维持长期推理、上下文连续性和智能体间通信,实现具有完整可追溯性的交互式和自省视频创作。这种设计使能够实现迭代和任意条件的视频工作流程(例如文本/图像/视频条件生成 多轮编辑 对象分割 组合性合成),这些工作流程以前仅能使用单一用途模型或单体视频语言模型来实现。我们还引入UniVA-Bench,一个覆盖理解、编辑、分割和生成的多步骤视频任务基准套件,用于严格评估此类智能体式视频系统。UniVA和UniVA-Bench均完全开源,旨在催化下一代多模态AI系统的交互式、智能体式和通用视频智能研究。(https://univa.online/)
引用
@article{arxiv.2511.08521,
title = {UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist},
author = {Zhengyang Liang and Daoan Zhang and Huichi Zhou and Rui Huang and Bobo Li and Yuechen Zhang and Shengqiong Wu and Xiaohan Wang and Jiebo Luo and Lizi Liao and Hao Fei},
journal= {arXiv preprint arXiv:2511.08521},
year = {2025}
}
备注
Technical Report. 24 figures, 37 pages. Website: https://univa.online/