面向实时人机交互的注意力导向动作识别
计算机视觉与模式识别
2020-07-03 v1
摘要
尽管动作识别任务已取得显著进展,但专门针对人机交互的动作识别研究尚不多见。本文深入探究交互场景下动作识别任务的特点,提出一种注意力导向的多级网络框架以满足实时交互需求。具体而言,首先采用预注意力网络在低分辨率下粗略聚焦场景中的交互者,随后在高分辨率下进行细粒度姿态估计。另一个紧凑型CNN接收提取的骨架序列作为输入进行动作识别,利用类注意力机制有效捕获局部时空模式与全局语义信息。为评估所提方法,我们构建了一个专用于交互场景下识别任务的新动作数据集。在我们数据集上的实验结果以及在移动计算平台(Nvidia Jetson AGX Xavier)上的高效率(640×480 RGBD下112 fps)证明了我们的方法在实时人机交互动作识别上具有优异的适用性。
引用
@article{arxiv.2007.01065,
title = {Attention-Oriented Action Recognition for Real-Time Human-Robot Interaction},
author = {Ziyang Song and Ziyi Yin and Zejian Yuan and Chong Zhang and Wanchao Chi and Yonggen Ling and Shenghao Zhang},
journal= {arXiv preprint arXiv:2007.01065},
year = {2020}
}
备注
8 pages, 8 figures