中文

为视障人士提出的视觉问题提供答案定位依据

计算机视觉与模式识别 2022-04-12 v3 计算与语言

摘要

视觉问答是关于图像回答问题的人物。我们引入了 VizWiz-VQA-Grounding 数据集,这是第一个为视障人士提出的视觉问题提供答案视觉定位依据的数据集。我们分析该数据集并与五个 VQA-Grounding 数据集比较,以说明其异同。随后我们评估了 SOTA 的 VQA 与 VQA-Grounding 模型,表明当前 SOTA 算法常无法识别答案所在的正确的视觉证据。这些模型在视觉证据仅占图像一小部分、图像质量较高以及视觉问题需要文本识别技能时经常表现不佳。数据集、评估服务器与排行榜均可在以下链接获取:https://vizwiz.org/tasks-and-datasets/answer-grounding-for-vqa/。

关键词

引用

@article{arxiv.2202.01993,
  title  = {Grounding Answers for Visual Questions Asked by Visually Impaired People},
  author = {Chongyan Chen and Samreen Anjum and Danna Gurari},
  journal= {arXiv preprint arXiv:2202.01993},
  year   = {2022}
}

备注

Computer Vision and Pattern Recognition