中文

基于多头神经网络的高效手势识别以辅助视障人士

计算机视觉与模式识别 2022-07-27 v1

摘要

本文提出一种由手势控制的移动设备交互系统,旨在帮助视障人士。该系统允许用户通过简单的静态与动态手势与设备交互。每种手势触发系统中的不同动作,如物体识别、场景描述或图像缩放(例如,用手指指向某物体将显示其描述)。系统基于多头神经网络架构,其首先检测并分类手势,随后根据检测到的手势执行第二阶段以完成相应动作。该多头架构优化了同时执行不同任务所需资源,并利用初始骨干网络获得的信息在第二阶段执行不同处理。为训练与评估系统,手动编译并标注了约4万张图像的数据集,包含不同类型手势、背景(室内与室外)、光照条件等。该数据集包含合成手势(其目的在于预训练系统以改善结果)以及使用不同手机拍摄的真实图像。所得结果及与现有最优方法的对比显示了系统所执行不同动作(如手势分类与定位精度,或物体与场景描述生成)的竞争力。

关键词

引用

@article{arxiv.2205.06980,
  title  = {Efficient Gesture Recognition for the Assistance of Visually Impaired People using Multi-Head Neural Networks},
  author = {Samer Alashhab and Antonio Javier Gallego and Miguel Ángel Lozano},
  journal= {arXiv preprint arXiv:2205.06980},
  year   = {2022}
}