NaviSense:面向视觉障碍者物体取回的多模态辅助移动应用
人机交互
2025-09-24 v1 人工智能
摘要
视觉障碍者通常在定位和取回周围物体时面临重大挑战。现有的辅助技术呈现出一种权衡:提供精确引导的系统通常需要预先扫描或仅支持固定的物体类别,而具备开放世界物体识别的系统则缺乏到达物体的空间反馈。为了填补这一空白,我们引入了“NaviSense”,一种移动辅助系统,它结合了对话式 AI、视觉语言模型、增强现实(AR)和 LiDAR,以支持开放世界物体检测并提供实时音频-触觉引导。用户通过自然语言指定物体,并接收连续的空间反馈以导航至目标,无需事先设置。NaviSense 基于形成性研究的见解进行设计,并经 12 名盲人和低视力参与者评估,显著缩短了物体取回时间,且优于现有工具,证明了将开放世界感知与精确、可访问的引导相结合的价值。
引用
@article{arxiv.2509.18672,
title = {NaviSense: A Multimodal Assistive Mobile application for Object Retrieval by Persons with Visual Impairment},
author = {Ajay Narayanan Sridhar and Fuli Qiao and Nelson Daniel Troncoso Aldas and Yanpei Shi and Mehrdad Mahdavi and Laurent Itti and Vijaykrishnan Narayanan},
journal= {arXiv preprint arXiv:2509.18672},
year = {2025}
}