中文

卷积神经网络有多智能?

计算机视觉与模式识别 2017-11-02 v2

摘要

受格式塔图形理论和语言理解的 Winograd 挑战启发,我们设计了合成实验来研究深度学习算法从样本中推断简单(至少对人类而言)视觉概念(如对称性)的能力。视觉概念由随机生成的正例和负例图像表示。然后我们测试算法(和人类)从这些图像中学习该概念的能力和速度。训练和测试在多轮中渐进式进行,随后的每一轮都被刻意设计得比前几轮更复杂、更易混淆,尤其是在学习者未掌握该概念的情况下。然而,如果理解了该概念,所有刻意设计的测试都将变得极其容易。我们的实验表明,人类通常在仅查看极少量样本后就能快速推断出语义概念(这通常被称为“顿悟时刻”:突然领悟的瞬间),并在所有测试轮次中表现完美(除粗心错误外)。相反,深度卷积神经网络(DCNN)可以在统计上近似某些概念,但只有在看到多出许多(x10^4)的样本之后。而且它仍然会犯明显的错误,特别是在刻意设计的测试轮次或训练分布之外的样本上。这表明缺乏真正的“理解”,或者未能达到正确的语义“公式”。我们确实发现某些概念对 DCNN 来说比其他概念更容易。例如,简单的“计数”比“对称性”更容易学习,而“均匀性”或“一致性”对 DCNN 来说则困难得多。最后,我们提出视觉感知的“顿悟挑战”,呼吁利用有限的训练样本对格式塔式机器智能进行集中且定量的研究。

关键词

引用

@article{arxiv.1709.06126,
  title  = {How intelligent are convolutional neural networks?},
  author = {Zhennan Yan and Xiang Sean Zhou},
  journal= {arXiv preprint arXiv:1709.06126},
  year   = {2017}
}

备注

add one more experiment: common fate task; add link to github