VideoExpert:用于时序敏感视频理解的增强型LLM
计算机视觉与模式识别
2025-04-11 v1
摘要
视频理解的核心挑战在于感知随时间变化的动态内容。然而,多模态大语言模型在处理时序敏感视频任务时表现不佳,这些任务需要生成时间戳来标记特定事件发生时间。现有策略要求MLLMs直接生成绝对或相对时间戳,但我们观察到,这些MLLMs倾向于更多依赖语言模式而非视觉线索来生成时间戳,从而影响其性能。为此,我们提出VideoExpert,一个适用于多种时序敏感视频任务的通用MLLMs。灵感来源于专家概念,VideoExpert集成了两个平行模块:时序专家和空间专家。时序专家负责建模时间序列和执行时序定位。它处理高帧率但压缩后的 token 以捕获视频中的动态变化,并包含一个轻量级预测头用于精确事件定位。空间专家专注于内容细节分析和指令遵循。它处理专为设计的空间 token 和语言输入,旨在生成与内容相关的响应。这两个专家通过一种特殊 token 无缝协作,确保时序定位与内容生成协调。值得注意的是,时序和空间专家保持独立的参数集。通过将时序定位从内容生成中卸载,VideoExpert防止了文本模式偏差在时间戳预测中的影响。此外,我们引入了空间压缩模块以获取空间 token。该模块筛选并压缩 patch token 同时保留关键信息,为空间专家提供紧凑且信息丰富的输入。广泛的实验表明,VideoExpert 在有效性和多样性方面都表现出色。
引用
@article{arxiv.2504.07519,
title = {VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding},
author = {Henghao Zhao and Ge-Peng Ji and Rui Yan and Huan Xiong and Zechao Li},
journal= {arXiv preprint arXiv:2504.07519},
year = {2025}
}