中文

图像描述中指向新颖目标

计算机视觉与模式识别 2019-04-26 v1

摘要

图像描述在近期进展中获得了显著关注并取得了显著改进。然而,野外图像蕴含丰富的知识,无法用仅包含域内目标、基于图像-描述对构建的模型充分描述。在本文中,我们提出通过用目标学习器增强标准深度描述架构来解决该问题。具体而言,我们提出带有指向的长短期记忆网络(LSTM-P)——一种新架构,其通过指向机制促进词汇扩展并生成新颖目标。在技术上,目标学习器最初在可用目标识别数据上预训练。LSTM-P中的指向然后在解码阶段每一步平衡通过LSTM生成词与从已识别目标复制词的概率。此外,我们的描述鼓励句子中目标的全局覆盖。我们在留出的COCO图像描述和ImageNet数据集上进行了大量实验以描述新颖目标,与最先进方法相比报告了优越结果。更值得注意的是,我们在留出的COCO数据集上获得了60.9%的F1分数平均值。

关键词

引用

@article{arxiv.1904.11251,
  title  = {Pointing Novel Objects in Image Captioning},
  author = {Yehao Li and Ting Yao and Yingwei Pan and Hongyang Chao and Tao Mei},
  journal= {arXiv preprint arXiv:1904.11251},
  year   = {2019}
}

备注

CVPR 2019