中文

SceneScout:面向盲人用户的基于 AI 智能体的街景图像访问系统

人机交互 2025-04-15 v1

摘要

盲人或视力受限者(BLV)可能因对物理环境不确定性而犹豫独立探索陌生环境。虽然大多数工具侧重于现场导航,但那些提供旅行前帮助的工具仅提供地标和逐步指示,缺乏详细的视觉背景信息。街景图像包含丰富的视觉信息,具有揭示大量环境细节的潜力,却 remains 不可及于 BLV 人士。本文提出 SceneScout,一种由多模态大语言模型(MLLM)驱动的 AI 智能体,实现对街景图像的可访问交互。SceneScout 支持两种模式:(1)路线预览,使用户熟悉沿路线的视觉细节;(2)虚拟探索,使用户能够在街景图像中自由移动。我们的用户研究(N=10)表明,SceneScout 帮助 BLV 用户获取通过现有手段无法获取的视觉信息。技术评估显示,大多数描述都准确(72%),且在较旧图像中描述稳定的视觉元素(95%),尽管偶尔会出现难以验证的细微且似乎合理的错误。我们讨论了利用街景图像提升导航体验的未来机遇与挑战。

关键词

引用

@article{arxiv.2504.09227,
  title  = {SceneScout: Towards AI Agent-driven Access to Street View Imagery for Blind Users},
  author = {Gaurav Jain and Leah Findlater and Cole Gleason},
  journal= {arXiv preprint arXiv:2504.09227},
  year   = {2025}
}