面向视障人士的大型视觉-语言模型环境感知系统
计算机视觉与模式识别
2025-04-28 v1 人工智能
机器人学
摘要
由于自然场景的复杂性,视障人士面临环境感知的挑战,从而严重限制了其个人与社交活动。本文介绍一种基于大型视觉-语言模型(LVLM)的环境感知系统,通过佩戴式设备捕获当前场景,再通过设备获取分析结果,帮助视障人士更好地理解周围环境。视障人士可通过长按屏幕激活 LVLM 输出获取场景的整体描述,通过点击或滑动屏幕检索分割模型生成的场景中物体的类别,通过双击屏幕获取感兴趣物体的详细描述。为帮助视障人士更准确地感知世界,本文提出将 RGB 图像的分割结果作为外部知识输入到 LVLM 中,以减少其幻觉现象。技术实验在 POPE、MME 和 LLaVA-QA90 上表明,该系统相较于 Qwen-VL-Chat 能提供更准确的场景描述;探索性实验显示,该系统能够有效帮助视障人士感知周围环境。
引用
@article{arxiv.2504.18027,
title = {A Large Vision-Language Model based Environment Perception System for Visually Impaired People},
author = {Zezhou Chen and Zhaoxiang Liu and Kai Wang and Kohou Wang and Shiguo Lian},
journal= {arXiv preprint arXiv:2504.18027},
year = {2025}
}
备注
Accepted by IROS2024(9 pages, 8 figures)