中文

VocalEyes:基于视觉语言模型和距离感知目标检测,提升视障者的环境感知能力

人机交互 2025-03-26 v1 计算机视觉与模式识别 机器学习

摘要

随着对促进视障人士独立性和灵活性的辅助技术需求的增加,本研究提出了一种创新的实时系统,通过音频描述用户周围环境以提高情境意识。该系统获取实时视频输入,并使用量化和微调的Florence-2大型模型处理,调整为4位精度以高效运行于低功耗边缘设备,如NVIDIA Jetson Orin Nano。通过将视频信号转换为具有5帧延迟的帧,模型为对象、行人和障碍物提供快速且具有上下文相关性的描述,同时估计其距离。该系统采用Parler TTS Mini,一种轻量且可适应的文本转语音(TTS)解决方案,提供高效的音频反馈。它支持34种不同的说话人类型,能够根据用户需求自定义语音语调、语速和语调。本研究检讨了用于修改Florence-2模型的量化和微调技术,说明了将紧凑模型架构与多功能TTS组件集成如何提高实时性能和用户体验。该系统根据其准确性、效率和实用性进行评估,为视障用户在安全且成功地导航其周围环境提供了可行的选项。

关键词

引用

@article{arxiv.2503.16488,
  title  = {VocalEyes: Enhancing Environmental Perception for the Visually Impaired through Vision-Language Models and Distance-Aware Object Detection},
  author = {Kunal Chavan and Keertan Balaji and Spoorti Barigidad and Samba Raju Chiluveru},
  journal= {arXiv preprint arXiv:2503.16488},
  year   = {2025}
}