中文

人与人交互检测

计算机视觉与模式识别 2023-08-14 v2 人工智能

摘要

对视频流中感兴趣的人与人交互(如排队、握手、打架和追逐)的全面理解,对于校园、广场和公园等区域的公共安全监控至关重要。与传统的人的交互识别不同——后者使用编排好的视频作为输入、忽略并发交互组、并在分离阶段执行检测与识别——我们引入了一项新任务,称为人与人交互检测(HID)。HID 致力于在一个模型中检测主体、识别个体动作,并根据交互关系对人进行分组。首先,基于为动作检测创建的流行 AVA 数据集,我们通过以逐帧方式标注交互关系,建立了一个新的 HID 基准,称为 AVA-Interaction(AVA-I)。AVA-I 包含 85,254 帧和 86,338 个交互组,每幅图像最多包含 4 个并发交互组。其次,我们提出了一种用于 HID 的新基线方法 SaMFormer,其包含一个视觉特征提取器、一个利用基于 Transformer 的模型解码动作实例与交互组的分割阶段,以及一个重建实例与组之间关系的合并阶段。所有 SaMFormer 组件均以端到端方式联合训练。在 AVA-I 上的大量实验验证了 SaMFormer 相对于代表性方法的优越性。数据集与代码将公开以促进更多后续研究。

关键词

引用

@article{arxiv.2307.00464,
  title  = {Human-to-Human Interaction Detection},
  author = {Zhenhua Wang and Kaining Ying and Jiajun Meng and Jifeng Ning},
  journal= {arXiv preprint arXiv:2307.00464},
  year   = {2023}
}