中文

人类对抗性视觉问答

计算机视觉与模式识别 2021-06-07 v1 计算与语言

摘要

在最常用的视觉问答数据集(VQA v2)上的性能正开始接近人类准确率。然而,在与最先进的 VQA 模型交互时,很明显该问题远未解决。为了对 VQA 模型进行压力测试,我们将其与人工对抗样本进行基准比较。人类受试者与最先进的 VQA 模型交互,并对数据集中的每张图像尝试找到一个模型预测答案错误的问题。我们发现一系列最先进模型在这些样本上评估时表现糟糕。我们对收集的对抗样本进行了广泛分析,并提供了未来研究方向的指导。我们希望这一对抗性 VQA(AdVQA)基准能帮助推动该领域进展并提升最先进水平。

关键词

引用

@article{arxiv.2106.02280,
  title  = {Human-Adversarial Visual Question Answering},
  author = {Sasha Sheng and Amanpreet Singh and Vedanuj Goswami and Jose Alberto Lopez Magana and Wojciech Galuba and Devi Parikh and Douwe Kiela},
  journal= {arXiv preprint arXiv:2106.02280},
  year   = {2021}
}

备注

22 pages, 13 figures. First two authors contributed equally