中文

基于眼镜式相机的头眼自我中心手势识别用于人机交互

计算机视觉与模式识别 2022-06-13 v2 人机交互 机器人学

摘要

在非言语交流在人机交互(HRI)的广泛场景中扮演着尤其重要的角色。相应地,本工作致力于解决人类手势识别问题。具体而言,我们聚焦于头部与眼部手势,并采用自我中心(第一人称)视角,使用眼镜式相机。我们认为,相较于场景中心或机器人中心视角,这一自我中心视角可带来若干概念上与技术上的益处。我们提出了一种基于运动的识别方法,其在两种时间粒度上运作。在局部,以卷积神经网络(CNN)估计帧间单应性。该CNN的输出被输入至长短期记忆网络(LSTM)以捕捉与刻画手势相关的更长时程时间视觉关系。关于网络架构的配置,一个尤其有趣的发现是:使用单应性CNN内部层的输出相较于使用单应性矩阵本身提高了识别率。尽管本工作聚焦于动作识别,且尚未开展机器人或用户研究,该系统仍被设计为满足实时约束。令人鼓舞的结果表明所提出的自我中心视角是可行的,且这一概念验证工作为令人振奋的HRI领域提供了新颖而有用的贡献。

关键词

引用

@article{arxiv.2201.11500,
  title  = {Head and eye egocentric gesture recognition for human-robot interaction using eyewear cameras},
  author = {Javier Marina-Miranda and V. Javier Traver},
  journal= {arXiv preprint arXiv:2201.11500},
  year   = {2022}
}

备注

Copyright 2022 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works