VizWiz 大挑战: 回答盲人的视觉问题
计算机视觉与模式识别
2018-05-23 v4 计算与语言
人机交互
摘要
当前自动回答视觉问题的算法研究受限于在人工 VQA 设定下构建的视觉问答(VQA)数据集。我们提出 VizWiz,首个源自自然 VQA 设定的目标导向 VQA 数据集。VizWiz 包含超过 31000 个视觉问题,来自盲人使用手机拍照并录下关于照片的口语问题,每个视觉问题附有 10 个众包答案。VizWiz 与许多现有 VQA 数据集不同在于:(1) 图像由盲人拍摄,因此常质量较差;(2) 问题为口语,因此更对话化;(3) 常存在无法回答的视觉问题。对用于回答视觉问题及判断视觉问题是否可答的现代算法的评估显示 VizWiz 是一个具挑战性的数据集。我们引入该数据集以鼓励更广社区开发可辅助盲人的更通用算法。
引用
@article{arxiv.1802.08218,
title = {VizWiz Grand Challenge: Answering Visual Questions from Blind People},
author = {Danna Gurari and Qing Li and Abigale J. Stangl and Anhong Guo and Chi Lin and Kristen Grauman and Jiebo Luo and Jeffrey P. Bigham},
journal= {arXiv preprint arXiv:1802.08218},
year = {2018}
}