中文

面向视障人士可穿戴系统的实时语义分割与场景识别感知框架

计算机视觉与模式识别 2021-03-09 v1 机器人学 图像与视频处理

摘要

由于包含物体性与场景类型在内的场景信息对视障人士十分重要,本文提出了一种用于场景解析与识别任务的多任务高效感知系统。基于紧凑的 ResNet 骨干网络,我们设计的网络架构具有两条共享参数的路径。该结构中,语义分割路径集成了快速注意力机制,旨在以高效方式获取长程上下文信息。同时,场景识别路径通过将语义特征传入语义驱动注意力网络,并利用门控注意力模块将语义提取表征与 RGB 提取表征相融合,实现场景类型推断。在实验中,我们在公开数据集与真实场景上验证了系统的准确性与效率。该系统运行于配备 Intel RealSense LiDAR 相机与 Nvidia Jetson AGX Xavier 处理器的可穿戴腰带上,可陪伴视障人士并在其导航任务中提供辅助场景信息。

关键词

引用

@article{arxiv.2103.04136,
  title  = {Perception Framework through Real-Time Semantic Segmentation and Scene Recognition on a Wearable System for the Visually Impaired},
  author = {Yingzhi Zhang and Haoye Chen and Kailun Yang and Jiaming Zhang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2103.04136},
  year   = {2021}
}

备注

6 pages, 7 figures, 2 tables