中文

将复制机制融入图像描述以学习新物体

计算机视觉与模式识别 2017-08-18 v1 计算与语言

摘要

图像描述通常需要大量的训练图像-句子对。然而在实践中,获取充足的训练对总是成本高昂,这使得近期的描述模型在描述训练语料库之外的物体(即新物体)时能力受限。在本文中,我们提出了带有复制机制的长短期记忆网络——一种将复制机制融入卷积神经网络加循环神经网络图像描述框架的新架构,用于在描述中包含新物体。具体而言,利用公开可用的物体识别数据集来开发新物体的分类器。随后,我们的 LSTM-C 将解码器 RNN 的标准逐词句子生成与复制机制很好地结合在一起,该复制机制可以在输出句子的适当位置选择新物体中的词汇。在 MSCOCO 图像描述和 ImageNet 数据集上进行了大量实验,证明了我们提出的 LSTM-C 架构描述新物体的能力。此外,与最先进的深度模型相比,报告了更优的结果。

关键词

引用

@article{arxiv.1708.05271,
  title  = {Incorporating Copying Mechanism in Image Captioning for Learning Novel Objects},
  author = {Ting Yao and Yingwei Pan and Yehao Li and Tao Mei},
  journal= {arXiv preprint arXiv:1708.05271},
  year   = {2017}
}

备注

CVPR17