探索视觉-语言模型用于视障者导航辅助的潜力
计算机视觉与模式识别
2026-03-18 v1 人工智能
机器人学
摘要
本文探讨了视觉-语言模型 (VLMs) 在辅助视障人士 (pBLV) 完成导航任务方面的潜力。我们评估了包括 GPT-4V、GPT-4o、Gemini-1.5-Pro 和 Claude-3.5-Sonnet 在内的主流闭源模型,以及 Llava-v1.6-mistral 和 Llava-onevision-qwen 等开源模型,以分析其在基础视觉技能——计数环境障碍物、相对空间推理以及常见的场景理解——方面的能力。我们进一步评估了这些模型在导航情境中的表现,使用专为 pBLV 设计的提示词模拟真实世界的辅助任务。我们的发现揭示了这些模型之间存在显著的性能差异:GPT-4o 在所有任务中表现一致领先,尤其在空间推理和场景理解方面。相比之下,开源模型在复杂环境中的细粒度推理和适应性方面仍显不足。常见挑战包括在拥挤环境中准确计数物体的困难、空间推理中的偏差,以及倾向于优先关注物体细节而非空间反馈,从而限制了其为 pBLV 导航任务的可用性。尽管存在这些局限,VLMs 在路径规划辅助方面仍显示出潜力,当更好地对齐人类反馈并具备 improved 的空间推理能力时,可实现更佳的可用性。本研究为 VLMs 的开发者提供了可操作的见解,指导其将 VLMs 有效集成到辅助技术中,同时为提升可用性指明了关键局限。
引用
@article{arxiv.2603.15624,
title = {Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision},
author = {Yu Li and Yuchen Zheng and Giles Hamilton-Fletcher and Marco Mezzavilla and Yao Wang and Sundeep Rangan and Maurizio Porfiri and Zhou Yu and John-Ross Rizzo},
journal= {arXiv preprint arXiv:2603.15624},
year = {2026}
}