中文

无需强先验学习视觉推理

计算机视觉与模式识别 2017-12-20 v5 人工智能 计算与语言 机器学习

摘要

实现人工视觉推理——即回答需要多步、高层级过程的图像相关问题——是迈向人工通用智能的重要一步。这一多模态任务需要从语言中学习针对问题依赖的、结构化的图像推理过程。标准深度学习方法倾向于利用数据中的偏差而非学习这种底层结构,而领先的方法虽然能成功学习视觉推理,却是为推理手工设计的。我们展示了一种通用的条件批归一化(Conditional Batch Normalization)方法,在 CLEVR 视觉推理基准测试中以 2.4% 的错误率达到了最先进(SOTA)的结果。我们的表现优于次优的端到端方法(4.5%),甚至优于使用额外监督的方法(3.1%)。我们对模型进行了探测以揭示其推理方式,表明它已学会了一种依赖问题的多步过程。以往的工作基于视觉推理需要专用架构的假设,但我们表明,具有适当条件的通用架构可以有效学习视觉推理。

关键词

引用

@article{arxiv.1707.03017,
  title  = {Learning Visual Reasoning Without Strong Priors},
  author = {Ethan Perez and Harm de Vries and Florian Strub and Vincent Dumoulin and Aaron Courville},
  journal= {arXiv preprint arXiv:1707.03017},
  year   = {2017}
}

备注

Full AAAI 2018 paper is at arXiv:1709.07871. Presented at ICML 2017's Machine Learning in Speech and Language Processing Workshop. Code is at http://github.com/ethanjperez/film