中文

视觉问答:预测群体是否会对答案达成一致

人工智能 2016-08-30 v1 计算与语言 计算机视觉与模式识别 人机交互

摘要

视觉问答 (VQA) 系统源于一种愿望,即让用户能够就视觉内容提出任何自然语言问题,并得到一个有效的答案作为回应。然而,仔细审视 VQA 问题会发现一个不可避免且相互纠缠的问题:对于某个视觉问题,多人可能并不总是对单一答案达成一致。我们训练了一个模型,使其能够根据视觉问题自动预测群体是否会就单一答案达成一致。随后,我们提出如何在一个新颖的应用中利用该系统,以高效地分配人力来收集视觉问题的答案。具体而言,我们提出了一种众包系统,该系统在预期答案会达成一致时自动征集较少的人工响应,而在预期答案存在分歧时征集较多的人工响应。我们的系统改进了现有的众包系统,通常能在不损失从群体中收集到的信息的情况下,至少减少 20% 的人力投入。

关键词

引用

@article{arxiv.1608.08188,
  title  = {Visual Question: Predicting If a Crowd Will Agree on the Answer},
  author = {Danna Gurari and Kristen Grauman},
  journal= {arXiv preprint arXiv:1608.08188},
  year   = {2016}
}