中文

CLEVR_HYP:面向图像上假设性动作的视觉问答挑战数据集与基线方法

计算机视觉与模式识别 2021-04-14 v1

摘要

现有大多数视觉问答(VQA)研究局限于图像或视频中显式呈现的信息。在本文中,我们将视觉理解提升到更高层次,要求系统回答涉及在给定场景中 mentally 模拟执行特定动作的假设性后果的问题。为此,我们基于 CLEVR(Johnson et. al., 2017)数据集构建了一个视觉-语言问答任务。随后我们改进了现有最佳的 VQA 方法,并针对该任务提出了基线求解器。最后,我们通过揭示不同架构在图像-文本模态联合推理能力上的洞察,推动更优视觉-语言模型的发展。我们的数据集构建脚本与代码将在 https://github.com/shailaja183/clevr_hyp 公开提供。

关键词

引用

@article{arxiv.2104.05981,
  title  = {CLEVR_HYP: A Challenge Dataset and Baselines for Visual Question Answering with Hypothetical Actions over Images},
  author = {Shailaja Keyur Sampat and Akshay Kumar and Yezhou Yang and Chitta Baral},
  journal= {arXiv preprint arXiv:2104.05981},
  year   = {2021}
}

备注

16 pages, 11 figures, Accepted as a Long Paper at NAACL-HLT 2021