JARViS: 基于统一演员-场景上下文关系建模的视频动作检测
计算机视觉与模式识别
2024-09-18 v2 机器学习
摘要
视频动作检测(VAD)是一项具有挑战性的视觉任务,涉及在视频片段的空间和时间维度上对动作进行定位和分类。在众多VAD架构中,两阶段VAD方法利用预训练的人体检测器提取感兴趣区域特征,随后利用这些特征进行动作检测。然而,两阶段VAD方法的性能受到限制,因为它们仅依赖局部化的演员特征来推断动作语义。在本研究中,我们提出了一种新的两阶段VAD框架——基于视觉语义的联合演员-场景上下文关系建模(JARViS),该框架利用Transformer注意力机制有效地整合分布在空间和时间维度上的跨模态动作语义。JARViS使用人体检测器从关键帧中密集采样演员特征。同时,它使用视频骨干网络从视频片段中创建时空场景特征。最后,通过统一的动作-场景上下文Transformer对演员与场景之间的细粒度交互进行建模,并行输出最终的动作集合。实验结果表明,JARViS以显著优势超越了现有方法,并在三个流行的VAD数据集上达到了最先进的性能,包括AVA、UCF101-24和JHMDB51-21。
引用
@article{arxiv.2408.03612,
title = {JARViS: Detecting Actions in Video Using Unified Actor-Scene Context Relation Modeling},
author = {Seok Hwan Lee and Taein Son and Soo Won Seo and Jisong Kim and Jun Won Choi},
journal= {arXiv preprint arXiv:2408.03612},
year = {2024}
}
备注
31 pages, 10 figures, update references