中文

为视障人士所拍摄图像生成描述

计算机视觉与模式识别 2020-07-16 v2

摘要

尽管视觉领域的一个重要问题是设计能够自动为图像生成描述的算法,但少数可供算法开发的公开数据集直接关注真实用户的兴趣。观察到视障人士近十年来一直依赖(基于人工的)图像描述服务来了解他们所拍摄的图像,我们引入了首个代表这一真实用例的图像描述数据集。这一新数据集称为 VizWiz-Captions,包含超过 39,000 张来自视障人士的图像,每张图像配有五条描述。我们分析该数据集以(1)刻画典型描述,(2)刻画图像中内容的多样性,以及(3)将其内容与八个流行视觉数据集中的内容进行比较。我们还分析了现代图像描述算法,以识别使这一新数据集对视觉领域具有挑战性的因素。我们在 https://vizwiz.org 公开分享该数据集及描述挑战说明。

关键词

引用

@article{arxiv.2002.08565,
  title  = {Captioning Images Taken by People Who Are Blind},
  author = {Danna Gurari and Yinan Zhao and Meng Zhang and Nilavra Bhattacharya},
  journal= {arXiv preprint arXiv:2002.08565},
  year   = {2020}
}