中文

Vidi:用于视频理解和编辑的大型多模态模型

计算机视觉与模式识别 2025-07-18 v3

摘要

人类自然地与他们所连接的那些人共享信息,视频已成为互联网上通信和表达的主导媒介。为了支持高质量大规模视频内容的创建,需要一个全面的管道来理解原始输入材料(例如,由摄像机捕获的未编辑 footage)和编辑组件(例如,视觉特效)。在视频编辑场景中,模型必须处理多模态数据(例如,视觉、音频、文本),并具备强背景知识,同时处理灵活的输入长度(例如,小时级别的原始视频),这对传统模型构成重大挑战。本报告中,我们介绍了 Vidi,这是一系列用于广泛视频理解和编辑场景的大型多模态模型(LMM)。首次发布 focuses on 时间检索,即识别输入视频中对应给定文本查询的时间范围,这在智能编辑中发挥关键作用。该模型能够处理小时级别的视频,具备强大的时序理解能力,例如检索特定查询的时间范围。为支持现实场景下的全面评估,我们还提出了 VUE-TR 基准测试,介绍了五项关键改进。1)视频时长:显著长于现有时间检索数据集的视频;2)音频支持:包括基于音频的查询;3)查询格式:多样化的查询长度/格式;4)标注质量:ground-truth 时间范围是手动标注的。5)评估指标:用于支持多个时间范围的精细化 IoU 指标。令人惊讶的是,Vidi 在时间检索任务中显著优于领先的专有模型,例如 GPT-4o 和 Gemini,表明其在视频编辑场景中的优势。

关键词

引用

@article{arxiv.2504.15681,
  title  = {Vidi: Large Multimodal Models for Video Understanding and Editing},
  author = {Vidi Team and Celong Liu and Chia-Wen Kuo and Dawei Du and Fan Chen and Guang Chen and Jiamin Yuan and Lingxi Zhang and Lu Guo and Lusha Li and Longyin Wen and Qingyu Chen and Rachel Deng and Sijie Zhu and Stuart Siew and Tong Jin and Wei Lu and Wen Zhong and Xiaohui Shen and Xin Gu and Xing Mei and Xueqiong Qu and Zhenfang Chen},
  journal= {arXiv preprint arXiv:2504.15681},
  year   = {2025}
}