中文

LiGAR:用于多模态群体活动识别的激光雷达引导层次化 Transformer

计算机视觉与模式识别 2024-12-11 v2

摘要

由于多智能体交互的复杂性,群体活动识别(GAR)在计算机视觉中仍然具有挑战性。本文介绍了 LiGAR,一种用于多模态群体活动识别的激光雷达引导层次化 Transformer。LiGAR 利用激光雷达数据作为结构骨干来引导视觉和文本信息的处理,从而能够稳健地处理遮挡和复杂的空间布局。我们的框架集成了一个多尺度激光雷达 Transformer、跨模态引导注意力机制和一个自适应融合模块,以有效地在不同语义级别整合多模态数据。LiGAR 的层次化架构能够捕获从个体动作到场景级动态的各种粒度的群体活动。在 JRDB-PAR、Volleyball 和 NBA 数据集上进行的大量实验证明了 LiGAR 的卓越性能,在 JRDB-PAR 上 F1 分数提高了高达 10.6%,在 NBA 数据集上平均每类准确率提高了 5.9%,达到了最先进水平。值得注意的是,即使在推理时没有激光雷达数据,LiGAR 也能保持高性能,展示了其适应性。我们的消融研究突出了每个组件的显著贡献以及我们的多模态、多尺度方法在推进群体活动识别领域的有效性。

关键词

引用

@article{arxiv.2410.21108,
  title  = {LiGAR: LiDAR-Guided Hierarchical Transformer for Multi-Modal Group Activity Recognition},
  author = {Naga Venkata Sai Raviteja Chappa and Khoa Luu},
  journal= {arXiv preprint arXiv:2410.21108},
  year   = {2024}
}

备注

Accepted at WACV 2025; 14 pages, 4 figures, 10 tables