中文

面向实时人机交互的注意力导向动作识别

计算机视觉与模式识别 2020-07-03 v1

摘要

尽管动作识别任务已取得显著进展,但专门针对人机交互的动作识别研究尚不多见。本文深入探究交互场景下动作识别任务的特点,提出一种注意力导向的多级网络框架以满足实时交互需求。具体而言,首先采用预注意力网络在低分辨率下粗略聚焦场景中的交互者,随后在高分辨率下进行细粒度姿态估计。另一个紧凑型CNN接收提取的骨架序列作为输入进行动作识别,利用类注意力机制有效捕获局部时空模式与全局语义信息。为评估所提方法,我们构建了一个专用于交互场景下识别任务的新动作数据集。在我们数据集上的实验结果以及在移动计算平台(Nvidia Jetson AGX Xavier)上的高效率(640×480 RGBD下112 fps)证明了我们的方法在实时人机交互动作识别上具有优异的适用性。

关键词

引用

@article{arxiv.2007.01065,
  title  = {Attention-Oriented Action Recognition for Real-Time Human-Robot Interaction},
  author = {Ziyang Song and Ziyi Yin and Zejian Yuan and Chong Zhang and Wanchao Chi and Yonggen Ling and Shenghao Zhang},
  journal= {arXiv preprint arXiv:2007.01065},
  year   = {2020}
}

备注

8 pages, 8 figures