中文

NaVIP:面向视障人士的图像导向室内导航解决方案

计算机视觉与模式识别 2024-10-25 v1 人工智能

摘要

由于缺乏卫星定位,室内导航具有挑战性,这一挑战对于视障人士(VIPs)而言更为复杂,因为他们无法从指示牌获取信息。其他传感器信号(如蓝牙和LiDAR)可用于创建带有用户位置更新的逐步导航解决方案。不幸的是,这些解决方案需要在环境各处安装标签,或需要使用相对昂贵的硬件。此外,这些解决方案需要高度的手动参与,这会提高成本,限制了可扩展性。我们提出了一个图像数据集及其关联的图像导向解决方案,称为NaVIP,以实现面向视障人士的视觉智能,这是一个无基础设施、任务可扩展且可帮助VIPs理解其周围环境的解决方案。具体而言,我们精选了包含30万张手机摄像头数据的大规模数据集,覆盖四层研究楼,以奠定面向室内导航和探索的图像导向解决方案的基础。每张图像都标注了精确的6DoF相机姿态、室内热点信息(PoIs)以及描述性标题,以帮助VIPs。我们在两个主要方面进行基准测试:1)定位系统和2)探索支持,优先考虑训练可扩展性和实时推理,以验证图像解决方案向室内导航的前景。数据集、代码和模型检查点均公开于https://github.com/junfish/VIP_Navi。

关键词

引用

@article{arxiv.2410.18109,
  title  = {NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People},
  author = {Jun Yu and Yifan Zhang and Badrinadh Aila and Vinod Namboodiri},
  journal= {arXiv preprint arXiv:2410.18109},
  year   = {2024}
}

备注

40 pages, 20 figures