中文

VQA 疗法:通过答案视觉定位探究答案差异

计算机视觉与模式识别 2023-08-29 v2

摘要

视觉问答是一项预测关于图像的问题之答案的任务。鉴于不同人对同一视觉问题可提供不同答案,我们旨在通过答案定位更好地理解其原因。我们引入了首个将每个视觉问题的每个唯一答案进行视觉定位的数据集,称之为 VQAAnswerTherapy。随后我们提出两个新问题:预测一个视觉问题是否具有单一答案定位,以及定位所有答案位置。我们对解决这些新问题的现代算法进行基准测试,以展示其成功与不足。该数据集与评估服务器可公开获取:https://vizwiz.org/tasks-and-datasets/vqa-answer-therapy/。

关键词

引用

@article{arxiv.2308.11662,
  title  = {VQA Therapy: Exploring Answer Differences by Visually Grounding Answers},
  author = {Chongyan Chen and Samreen Anjum and Danna Gurari},
  journal= {arXiv preprint arXiv:2308.11662},
  year   = {2023}
}

备注

IEEE/CVF International Conference on Computer Vision