回答视觉问题所需的视觉技能
人机交互
2020-10-08 v1
摘要
回答关于图像的问题这一任务,既作为辅助视觉障碍人群的实际服务,也作为人工智能领域的视觉图灵测试而受到关注。我们的首要目标是识别这两种场景下所需的常见视觉技能。为此,我们分析了来自代表两种场景的两个数据集上超过 27,000 个视觉问题对四项视觉技能——物体识别、文本识别、颜色识别和计数——的需求。我们接下来在两个数据集上量化这些技能对人类与计算机的难度。最后,我们提出一项预测回答图像问题所需视觉技能的新任务。我们的结果揭示了此类服务的真实用户目标与 AI 社区关注点之间的(不)匹配。我们以关于视觉问答任务未来方向的讨论作结。
引用
@article{arxiv.2010.03160,
title = {Vision Skills Needed to Answer Visual Questions},
author = {Xiaoyu Zeng and Yanan Wang and Tai-Yin Chiu and Nilavra Bhattacharya and Danna Gurari},
journal= {arXiv preprint arXiv:2010.03160},
year = {2020}
}
备注
To be published on Proceedings of the ACM on Human-Computer Interaction, Vol. 4, No. CSCW2, Article 149. Publication date: October 2020