人类对抗性视觉问答
计算机视觉与模式识别
2021-06-07 v1 计算与语言
摘要
在最常用的视觉问答数据集(VQA v2)上的性能正开始接近人类准确率。然而,在与最先进的 VQA 模型交互时,很明显该问题远未解决。为了对 VQA 模型进行压力测试,我们将其与人工对抗样本进行基准比较。人类受试者与最先进的 VQA 模型交互,并对数据集中的每张图像尝试找到一个模型预测答案错误的问题。我们发现一系列最先进模型在这些样本上评估时表现糟糕。我们对收集的对抗样本进行了广泛分析,并提供了未来研究方向的指导。我们希望这一对抗性 VQA(AdVQA)基准能帮助推动该领域进展并提升最先进水平。
引用
@article{arxiv.2106.02280,
title = {Human-Adversarial Visual Question Answering},
author = {Sasha Sheng and Amanpreet Singh and Vedanuj Goswami and Jose Alberto Lopez Magana and Wojciech Galuba and Devi Parikh and Douwe Kiela},
journal= {arXiv preprint arXiv:2106.02280},
year = {2021}
}
备注
22 pages, 13 figures. First two authors contributed equally