中文

通过多模态大语言模型进行语言指令推理的群组活动检测

计算机视觉与模式识别 2025-12-08 v2

摘要

群组活动检测 (GAD) 旨在同时识别群组成员并对视频序列中他们的集体活动进行分类。现有的基于深度学习的方法开发了专门的架构(例如 transformer 网络)来建模个体角色的动态以及个体与群组之间的语义依赖关系。然而,它们仅依赖于从视觉特征中进行隐式模式识别,在上下文推理和可解释性方面存在困难。在这项工作中,我们提出了 LIR-GAD,一种通过多模态大语言模型 (MLLM) 进行 GAD 语言指令推理的新框架。我们的方法通过引入一个活动级别的 <ACT> 标记和多个特定于簇的 <GROUP> 标记,扩展了 MLLM 的原始词表。我们连同两个专门设计的标记和语言指令一起处理视频帧,然后将它们整合到 MLLM 中。MLLM 中嵌入的预训练常识知识使得 <ACT> 标记和 <GROUP> 标记能够分别有效捕获集体活动的语义信息并学习不同群组的判别性表示特征。此外,我们引入了多标签分类损失,以进一步增强 <ACT> 标记学习判别性语义表示的能力。然后,我们设计了一个多模态双对齐融合 (MDAF) 模块,将 MLLM 中对应于所设计标记的隐藏嵌入与视觉特征相融合,显著增强了 GAD 的性能。定量和定性实验均证明了我们提出的方法在 GAD 任务中的优越性能。

关键词

引用

@article{arxiv.2509.16054,
  title  = {Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model},
  author = {Jihua Peng and Qianxiong Xu and Yichen Liu and Chenxi Liu and Cheng Long and Rui Zhao and Ziyue Li},
  journal= {arXiv preprint arXiv:2509.16054},
  year   = {2025}
}

备注

This work is being incorporated into a larger study