中文

REACT:一次性识别各处的一切动作

计算机视觉与模式识别 2024-10-23 v1

摘要

群体活动识别 (GAR) 是计算机视觉中的一个基础问题,在体育视频分析、视频监控和社会场景理解中具有多样应用。与常规动作识别不同,GAR 旨在将一群个体的动作作为一个整体进行分类,需要深入理解其交互与时空关系。为应对 GAR 中的挑战,我们提出 REACT (\textbf{R}ecognize \textbf{E}very \textbf{Act}ion Everywhere All At Once),一种受 transformer 编码器-解码器模型启发、专为建模视频内复杂上下文关系(包括多模态与时空特征)而设计的新颖架构。我们的架构具有前沿的视觉-语言编码器块,用于整合的时间、空间和多模态交互建模。该组件高效编码时空交互,即便在稀疏采样帧下也能恢复关键的局部信息。我们的动作解码器块精炼文本与视频数据的联合理解,使我们能精确检索边界框,增强语义与视觉现实间的联系。其核心处,我们的参与者融合块协调参与者特定数据与文本特征的融合,在特异性和上下文间取得平衡。我们的方法在大量实验中优于最先进的 GAR 方法,在识别和理解群体活动方面展现出优越准确性。我们架构的潜力延伸至多样的真实应用,为其性能提升提供了经验证据。本工作显著推进了群体活动识别领域,为细致场景理解提供了鲁棒框架。

关键词

引用

@article{arxiv.2312.00188,
  title  = {REACT: Recognize Every Action Everywhere All At Once},
  author = {Naga VS Raviteja Chappa and Pha Nguyen and Page Daniel Dobbs and Khoa Luu},
  journal= {arXiv preprint arXiv:2312.00188},
  year   = {2024}
}

备注

10 pages, 4 figures, 5 tables