面向视力受损者的 AI 驱动可穿戴视觉辅助系统:集成大型视觉-语言模型的实时目标识别与情境理解
计算机视觉与模式识别
2024-12-31 v1
摘要
视力受损影响了人们像正常人一样生活的能力。这些人在执行日常活动(如阅读、写作、旅行和参与社交聚会)时会面临挑战。虽然已有许多传统方法可帮助视力受损者,但这些方法受限于获取丰富情境环境信息的能力,无法实现独立生活。为克服这一限制,本文引入一种新型可穿戴视觉辅助系统,该系统配备帽子安装摄像头,通过树莓派 4 Model B (8GB RAM) 进行人工智能技术处理,将实时反馈通过声音 beep 机制传递给用户。该系统的关键特性包括用户友好的新目标或物体识别程序,通过单次点击过程允许用户添加新个体与物体数据,以供后续检测使用,提升识别精度。系统利用大型视觉语言模型 (LVLM) 提供环境中物体的详细描述。此外,系统集成距离传感器,一旦用户即将与物体碰撞,即触发 beep 声,以确保在导航环境时获得安全保障。对所提出的 AI 驱动解决方案进行全面评估,与传统辅助技术进行比较分析。结果表明,本方案凭借硬件与 AI(包括 LVLMs 与物联网技术)的创新组合,为解决视力受损社群面临的主要问题提供了显著性进步。
引用
@article{arxiv.2412.20059,
title = {AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models},
author = {Mirza Samad Ahmed Baig and Syeda Anshrah Gillani and Shahid Munir Shah and Mahmoud Aljawarneh and Abdul Akbar Khan and Muhammad Hamzah Siddiqui},
journal= {arXiv preprint arXiv:2412.20059},
year = {2024}
}
备注
N-A