通过合成数据集设计考察神经网络架构
计算机视觉与模式识别
2022-04-26 v1 人工智能
摘要
近年来出现了许多新的神经网络结构(架构与层)。为解决给定任务,网络需要其结构中反映的某些能力。所需能力取决于每个任务。迄今为止,对已有神经结构真实容量的系统性研究尚属空白。每种结构能做什么、不能做什么,仅通过其于常用基准上的性能得到部分回答。事实上,自然数据包含复杂的未知统计线索。因此不可能知道给定神经结构在这些数据中利用了什么线索。本工作中,我们勾勒了一种通过设计专门合成数据集来衡量每种结构对网络能力影响的方法论。每个数据集用于评估一种给定能力,并被简化为最简形式:每个输入恰好包含解决该任务所需的信息量。我们构建了三个数据集来评测以下三种网络特性以阐明该方法论:a) 将局部线索关联到远距离推断的能力,b) 平移协方差,c) 将具有相同特征的像素分组并在其间共享信息的能力。使用首个简化深度估计数据集,我们精确定位了U-Net严重的非局部缺陷。随后我们评估如何通过嵌入非局部层来弥补该局限,非局部层可计算具有长程依赖的复杂特征。使用第二个数据集,我们比较了不同位置编码方法,并借助结果进一步提升U-Net在深度估计任务上的表现。第三个引入的数据集用于证明在解决更现实的深度估计任务时需要类自注意力机制。
引用
@article{arxiv.2204.11045,
title = {Investigating Neural Architectures by Synthetic Dataset Design},
author = {Adrien Courtois and Jean-Michel Morel and Pablo Arias},
journal= {arXiv preprint arXiv:2204.11045},
year = {2022}
}
备注
Accepted at the VDU2022 workshop hosted at CVPR2022