中文

利用深度孪生与三元组卷积网络并通过最小化全局损失函数学习局部图像描述符

计算机视觉与模式识别 2016-08-02 v2

摘要

近期训练深度卷积神经网络(ConvNet)模型的创新激发了自动学习局部图像描述符的新方法设计。为此任务提出的最新深度卷积网络由一个孪生网络组成,该网络通过惩罚局部图像块对的不正确分类进行训练。机器学习当前结果表明,在若干问题中用三元组网络替换此孪生网络可提高分类准确率,但这在局部图像描述符学习中尚待证明。此外,当前的孪生与三元组网络使用随机梯度下降训练,该下降从局部图像块的对或三元组计算梯度,这可能使它们易于过拟合。本文中,我们首先提出将三元组网络用于局部图像描述符学习问题。进而,我们还提出使用最小化训练集中整体分类误差的全局损失,这能提升模型的泛化能力。利用用于比较局部图像描述符的 UBC 基准数据集,我们表明三元组网络在 UBC 数据集误差方面产生了比孪生网络更精确的嵌入。此外,我们还证明使用该三元组网络时,三元组与全局损失的组合产生了该领域最佳的嵌入。最后,我们也展示了使用以全局损失训练的中心-环绕孪生网络在 UBC 数据集上产生了该领域最佳结果。预训练模型可在 https://github.com/vijaykbg/deep-patchmatch 在线获取。

关键词

引用

@article{arxiv.1512.09272,
  title  = {Learning Local Image Descriptors with Deep Siamese and Triplet Convolutional Networks by Minimising Global Loss Functions},
  author = {Vijay Kumar B G and Gustavo Carneiro and Ian Reid},
  journal= {arXiv preprint arXiv:1512.09272},
  year   = {2016}
}

备注

IEEE Conference on Computer Vision and Pattern Recognition 2016 (CVPR 2016)