中文

用于局部鲁棒描述生成的CNN空间金字塔VLAD编码稠密图像表示

计算机视觉与模式识别 2016-03-31 v1

摘要

使用卷积神经网络(CNN)从图像中提取特征并使用循环神经网络(RNN)生成描述的工作流已成为图像描述生成任务的事实上的标准。然而,由于CNN特征最初是为分类任务设计的,它主要关注图像的主要显著元素,并且经常无法正确传达局部、次要元素的信息。我们提议将局部聚合描述子向量(VLAD)在空间金字塔上的编码结合到子区域的CNN特征中,以生成更好地反映图像局部信息的图像表示。我们的结果表明,我们的紧凑VLAD编码方法仅以低至3%的维度即可匹配CNN特征,并且当与空间金字塔结合时,它产生了更准确地考虑局部元素的图像描述。

关键词

引用

@article{arxiv.1603.09046,
  title  = {Dense Image Representation with Spatial Pyramid VLAD Coding of CNN for Locally Robust Captioning},
  author = {Andrew Shin and Masataka Yamaguchi and Katsunori Ohnishi and Tatsuya Harada},
  journal= {arXiv preprint arXiv:1603.09046},
  year   = {2016}
}

备注

submitted to ECCV2016