中文

面向视障人士的大型视觉-语言模型环境感知系统

计算机视觉与模式识别 2025-04-28 v1 人工智能 机器人学

摘要

由于自然场景的复杂性,视障人士面临环境感知的挑战,从而严重限制了其个人与社交活动。本文介绍一种基于大型视觉-语言模型(LVLM)的环境感知系统,通过佩戴式设备捕获当前场景,再通过设备获取分析结果,帮助视障人士更好地理解周围环境。视障人士可通过长按屏幕激活 LVLM 输出获取场景的整体描述,通过点击或滑动屏幕检索分割模型生成的场景中物体的类别,通过双击屏幕获取感兴趣物体的详细描述。为帮助视障人士更准确地感知世界,本文提出将 RGB 图像的分割结果作为外部知识输入到 LVLM 中,以减少其幻觉现象。技术实验在 POPE、MME 和 LLaVA-QA90 上表明,该系统相较于 Qwen-VL-Chat 能提供更准确的场景描述;探索性实验显示,该系统能够有效帮助视障人士感知周围环境。

关键词

引用

@article{arxiv.2504.18027,
  title  = {A Large Vision-Language Model based Environment Perception System for Visually Impaired People},
  author = {Zezhou Chen and Zhaoxiang Liu and Kai Wang and Kohou Wang and Shiguo Lian},
  journal= {arXiv preprint arXiv:2504.18027},
  year   = {2025}
}

备注

Accepted by IROS2024(9 pages, 8 figures)