中文

ActivityCLIP:通过从文本挖掘补充信息以增强群体活动识别

计算机视觉与模式识别 2024-07-30 v1

摘要

以往的方法通常仅提取图像模态的信息来识别群体活动。然而,挖掘图像信息正趋于饱和,难以提取更丰富的信息。因此,从其他模态(如文本)提取补充信息以补充图像信息变得日益重要。事实上,动作标签提供了清晰的文本信息来表达动作的语义,而现有方法常常忽视了这一点。因此,我们提出了 ActivityCLIP,这是一种即插即用的方法,用于从动作标签中挖掘文本信息,以补充图像信息并增强群体活动识别。ActivityCLIP 由文本和图像两个分支组成,其中文本分支被插拔到图像分支中(基于现有的图像方法)。文本分支包括 Image2Text 和关系建模模块。具体而言,我们提出了知识传递模块 Image2Text,它通过知识蒸馏将图像信息适应为由 CLIP 提取的文本信息。进一步,为保持方法的便捷性,我们在图像分支的关系模块基础上添加了少量可训练参数,以建模文本分支中的相互作用关系。为展示我们方法的通用性,我们通过 ActivityCLIP 复现了三个具有代表性的方法,这些方法仅添加了有限的可训练参数,为每个方法实现了 favorable 的性能提升。我们还进行了大量的消融研究,并与最新的方法进行了比较,以证明 ActivityCLIP 的有效性。

关键词

引用

@article{arxiv.2407.19820,
  title  = {ActivityCLIP: Enhancing Group Activity Recognition by Mining Complementary Information from Text to Supplement Image Modality},
  author = {Guoliang Xu and Jianqin Yin and Feng Zhou and Yonghao Dang},
  journal= {arXiv preprint arXiv:2407.19820},
  year   = {2024}
}