基于视觉问答事件地图的低视力人群城市风险感知导航
计算机视觉与模式识别
2026-05-13 v1
摘要
视力障碍影响着全球数亿人,严重限制了他们安全、独立地在城市环境中导航的能力。虽然可穿戴辅助设备为实时危险检测提供了一个有前景的平台,但现有方法依赖于缺乏灵活性和泛化能力的特定任务视觉流程。在这项工作中,我们提出了一种基于视觉问答的事件地图框架,该框架利用视觉-语言模型(Vision-Language Models, VLMs)进行行人场景描述和跨多种真实环境的风险识别,使用三层分层查询结构实现细粒度场景理解,无需针对特定任务重新训练。模型响应被聚合到一个加权风险评分系统中,该系统将街道段映射为四个离散的安全类别,从而生成用于路径规划的可导航风险感知事件地图。为了支持评估和未来研究,我们引入了一个跨越六大洲20个城市的地理多样化数据集,包含800多张标注图像和18000个已回答的问题。我们对四种VQA架构——ViLT、LLaVA、InstructBLIP和Qwen-VL——进行了基准测试,发现生成式多模态大语言模型(Multimodal Large Language Models, MLLMs)在性能上显著优于基于分类的方法,其中Qwen-VL在精确率和召回率之间取得了最佳的整体平衡。这些结果证明了MLLMs作为视障人士辅助导航系统的灵活且可泛化的基础是可行的。
引用
@article{arxiv.2605.11782,
title = {Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision},
author = {Antoni Valls and Jordi Sanchez-Riera},
journal= {arXiv preprint arXiv:2605.11782},
year = {2026}
}
备注
10 pages, 6 figures, submitted to IEEE T-ITS