中文

面向视障人士的逐向室内导航

计算机视觉与模式识别 2024-10-29 v1

摘要

由于复杂的布局和 GPS 信号的缺失,在室内环境中导航对视障人士构成了重大挑战。本文引入了一种新颖的系统,该系统仅使用配备摄像头的智能手机提供建筑物内的逐向导航,利用多模态模型、深度学习算法和大型语言模型。智能手机的摄像头捕捉周围环境的实时图像,随后将其发送到能够在设备上运行 LLM 模型、多模态模型和深度学习算法的附近 Raspberry Pi,以检测和识别建筑特征、标牌和障碍物。然后,在 Raspberry Pi 上运行的 LLM 将解释后的视觉数据翻译成自然语言指令,并发回给用户,通过音频提示提供直观且具备上下文感知的引导。该解决方案在用户设备上所需的工作负载极小,防止其过载,并与所有类型的设备兼容,包括那些无法运行 AI 模型的设备。这种方法使客户端不仅能运行高级模型,还能确保训练数据和其他信息不离开建筑物。初步评估表明,该系统在准确引导用户穿越复杂室内空间方面是有效的,突显了其广泛应用的潜力。

关键词

引用

@article{arxiv.2410.19954,
  title  = {Turn-by-Turn Indoor Navigation for the Visually Impaired},
  author = {Santosh Srinivasaiah and Sai Kumar Nekkanti and Rohith Reddy Nedhunuri},
  journal= {arXiv preprint arXiv:2410.19954},
  year   = {2024}
}