中文

将有效标记与视频异常事件对齐:基于大语言模型的 MLLM 方法

计算机视觉与模式识别 2025-11-04 v2

摘要

理解视频中的异常事件是一项关键且具有挑战性的任务,已在广泛的应用场景中受到广泛关注。尽管当前的视频理解多模态大语言模型(MLLM)能够分析一般视频,但往往难以处理异常情况,因为异常事件在空间和时间上稀疏,冗余信息常导致结果不理想。为解决这些挑战,我们利用视觉语言模型(VLM)和大语言模型(LLM)的表示与泛化能力,提出了 VA-GPT,一种用于总结和定位各种视频中异常事件的新型 MLLM。我们的方法通过两个关键提出的模块:空间有效标记选择(SETS)和时间有效标记生成(TETG),高效地在视觉编码器和 LLM 之间对齐有效标记。这两个模块使我们的模型能够有效捕获和分析与异常事件相关的空间和时间信息,从而实现更准确的响应和交互。此外,我们构建了一个专为微调视频异常感知 MLLM 而设计的指令遵循数据集,并在基于 XD-Violence 数据集的跨域评估基准上引入了新的评估框架。我们的方法在各种基准测试中超越了现有的前沿方法。

关键词

引用

@article{arxiv.2508.06350,
  title  = {Aligning Effective Tokens with Video Anomaly in Large Language Models},
  author = {Yingxian Chen and Jiahui Liu and Ruidi Fan and Yanwei Li and Chirui Chang and Shizhen Zhao and Wilton W. T. Fok and Xiaojuan Qi and Yik-Chung Wu},
  journal= {arXiv preprint arXiv:2508.06350},
  year   = {2025}
}