中文

度量CLEVRness:视觉推理模型的黑盒测试

机器学习 2022-03-01 v2 人工智能 计算机视觉与模式识别

摘要

我们如何度量智能系统的推理能力?视觉问答通过就场景提问来询问模型,为测试模型能力提供了便利框架。然而,尽管存在大量各类视觉问答数据集与架构(有时甚至取得超越人类的表现),这些架构是否真正具备推理能力仍存争议。为回答此问题,我们扩展视觉问答框架并提出以下以双人博弈形式呈现的行为测试。我们考虑CLEVR的黑盒神经模型。这些模型在基准化推理的诊断数据集上训练。接下来,我们训练一个对抗玩家重新配置场景以愚弄CLEVR模型。我们表明,原本可达到人类水平的CLEVR模型能被我们的智能体轻易愚弄。我们的结果令人生疑:数据驱动方法能否在不利用那些数据集中常存在的众多偏差的情况下进行推理。最后,我们还提出一项受控实验,度量此类模型学习与执行推理的效率。

关键词

引用

@article{arxiv.2202.12162,
  title  = {Measuring CLEVRness: Blackbox testing of Visual Reasoning Models},
  author = {Spyridon Mouselinos and Henryk Michalewski and Mateusz Malinowski},
  journal= {arXiv preprint arXiv:2202.12162},
  year   = {2022}
}

备注

ICLR 2022