面向视障人士的多模态交互:NaviGPT,一种实时 AI 驱动的移动导航系统
人机交互
2024-10-08 v1
摘要
针对视障人士 (PVI) 的辅助技术取得了显著进展,尤其是人工智能 (AI) 和实时传感器技术的集成。然而,当前解决方案常常需要 PVI 在完成诸如图像识别、导航和障碍检测等任务时在多个应用和工具之间切换,这会阻碍实现顺畅且高效的用户体验。本文我们提出 NaviGPT,一个高保真原型,集成了基于 LiDAR 的障碍检测、振动反馈以及大型语言模型 (LLM) 响应,为 PVI 提供全面且实时的导航辅助。与现有应用如 Be My AI 和 Seeing AI 不同,NaviGPT 将图像识别和情境导航指导整合到单个系统中,提供关于用户周围环境的持续反馈,而无需切换应用。同时,NaviGPT 利用位置和传感器数据弥补 LLM 响应延迟,旨在为 PVI 在动态环境中提供实用且高效的导航支持。
引用
@article{arxiv.2410.04005,
title = {Enhancing the Travel Experience for People with Visual Impairments through Multimodal Interaction: NaviGPT, A Real-Time AI-Driven Mobile Navigation System},
author = {He Zhang and Nicholas J. Falletta and Jingyi Xie and Rui Yu and Sooyeon Lee and Syed Masum Billah and John M. Carroll},
journal= {arXiv preprint arXiv:2410.04005},
year = {2024}
}
备注
7 pages, 3 figures, this work has been accepted by the 2025 ACM International Conference on Supporting Group Work (GROUP '25)