FocusChat:基于时空信息过滤的文本引导长视频理解
计算机视觉与模式识别
2025-05-29 v2
摘要
最近,多模态大语言模型取得了显著进展。然而,缺乏来自用户意图指导的视觉信息可能导致冗余计算,并涉及不必要的视觉噪声,尤其是在长篇未剪辑视频中。为此,我们提出了 FocusChat,一种以文本为导向的多模态大语言模型(LLM),强调与用户提示相关的视觉信息。具体而言,我们的模型首先经过语义提取模块,该模块包含视觉语义分支和文本语义分支,分别用于提取图像和文本语义。该方法利用时空过滤模块(STFM)将两个分支组合。STFM 实现了显式的空间层级信息过滤和隐式的时间层级特征过滤,确保视觉标记与用户查询紧密对齐。它降低了输入到大语言模型中的视觉标记数量。FocusChat 在零样本实验中显著优于 Video-LLaMA,仅使用 16 个视觉标记,训练数据量只有原来的数量级。它在 few-shot 实验中实现了与最先进方法相当的效果,仅使用 0.72M 预训练数据。
引用
@article{arxiv.2412.12833,
title = {FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering},
author = {Zheng Cheng and Rendong Wang and Zhicheng Wang},
journal= {arXiv preprint arXiv:2412.12833},
year = {2025}
}
备注
11 pages, 4 figures