中文

利用姿态信息改进目标类别的深度学习

计算机视觉与模式识别 2017-01-24 v3

摘要

尽管近期取得了重大进展,但现有最佳的计算机视觉算法仍远落后于人类的能力,甚至在各种姿态、光照和背景下识别单个离散物体时也是如此。在此,我们提出了一种利用物体姿态信息来改进深度网络学习的新方法。虽然现有的大规模数据集(如 ImageNet)没有姿态信息,但我们利用新发布的转台数据集 iLab-20M 进行更受控的物体识别实验,该数据集包含约 2200 万张在 不同光照、相机视角和转台旋转下拍摄的 704 个物体实例的图像。我们引入了一种新的卷积神经网络架构,即 what/where CNN (2W-CNN),它建立在直链前馈 CNN(如 AlexNet)的基础上,并通过由物体姿态正则化的分层结构进行增强。在训练期间,姿态信息仅作为反馈信号与类别信息一起使用;在测试期间,前馈网络仅预测类别。为了验证该方法,我们使用部分数据集训练了 2W-CNN 和 AlexNet,2W-CNN 在类别预测上实现了 6% 的性能提升。我们在数学上证明了在随机梯度下降(SGD)优化过程中,2W-CNN 相比 AlexNet 具有内在优势。此外,我们利用在 iLab-20M 上预训练的 2W-CNN 和 AlexNet 特征对 ImageNet 上的物体识别进行微调,结果表明,与从头训练 AlexNet 相比取得了显著提升。而且,微调 2W-CNN 特征的表现甚至优于微调预训练的 AlexNet 特征。这些结果表明,在 iLab-20M 上预训练的特征能很好地泛化到自然图像数据集,并且 2W-CNN 比 AlexNet 学习到了更好的物体识别特征。

关键词

引用

@article{arxiv.1607.05836,
  title  = {Improved Deep Learning of Object Category using Pose Information},
  author = {Jiaping Zhao and Laurent Itti},
  journal= {arXiv preprint arXiv:1607.05836},
  year   = {2017}
}

备注

10 pages, accepted by WACV 2017