中文

辅助盲人与低视力者环境交互的多模态基础模型

计算机视觉与模式识别 2024-04-30 v2 人工智能

摘要

盲人与低视力者(pBLV)在陌生环境中进行全面的场景识别和精确的物体识别时面临巨大挑战。此外,由于视力丧失,pBLV难以自行察觉和识别潜在的绊倒危险。本文提出一种利用大型视觉-语言模型增强pBLV视觉感知的开创性方法,提供周围环境的详细全面描述并预警潜在风险。我们的方法首先利用大型图像标注模型(即 Recognize Anything (RAM))识别所捕获图像中存在的所有常见物体。随后,识别结果与用户查询通过提示工程被整合为专门针对pBLV的提示。通过将提示与输入图像结合,大型视觉-语言模型(即 InstructBLIP)生成详细全面的环境描述,并通过分析与提示相关的环境物体与场景来识别环境中的潜在风险。我们在室内与室外数据集上通过实验评估了该方法。结果表明,我们的方法能够准确识别物体,并为pBLV提供对环境富有洞察力的描述与分析。

关键词

引用

@article{arxiv.2310.20225,
  title  = {A Multi-Modal Foundation Model to Assist People with Blindness and Low Vision in Environmental Interaction},
  author = {Yu Hao and Fan Yang and Hao Huang and Shuaihang Yuan and Sundeep Rangan and John-Ross Rizzo and Yao Wang and Yi Fang},
  journal= {arXiv preprint arXiv:2310.20225},
  year   = {2024}
}