中文

NaviSense:面向视觉障碍者物体取回的多模态辅助移动应用

人机交互 2025-09-24 v1 人工智能

摘要

视觉障碍者通常在定位和取回周围物体时面临重大挑战。现有的辅助技术呈现出一种权衡:提供精确引导的系统通常需要预先扫描或仅支持固定的物体类别,而具备开放世界物体识别的系统则缺乏到达物体的空间反馈。为了填补这一空白,我们引入了“NaviSense”,一种移动辅助系统,它结合了对话式 AI、视觉语言模型、增强现实(AR)和 LiDAR,以支持开放世界物体检测并提供实时音频-触觉引导。用户通过自然语言指定物体,并接收连续的空间反馈以导航至目标,无需事先设置。NaviSense 基于形成性研究的见解进行设计,并经 12 名盲人和低视力参与者评估,显著缩短了物体取回时间,且优于现有工具,证明了将开放世界感知与精确、可访问的引导相结合的价值。

关键词

引用

@article{arxiv.2509.18672,
  title  = {NaviSense: A Multimodal Assistive Mobile application for Object Retrieval by Persons with Visual Impairment},
  author = {Ajay Narayanan Sridhar and Fuli Qiao and Nelson Daniel Troncoso Aldas and Yanpei Shi and Mehrdad Mahdavi and Laurent Itti and Vijaykrishnan Narayanan},
  journal= {arXiv preprint arXiv:2509.18672},
  year   = {2025}
}