中文

DenseCap:用于密集字幕的全卷积定位网络

计算机视觉与模式识别 2015-11-25 v1 机器学习

摘要

我们引入了密集字幕任务,它要求计算机视觉系统用自然语言定位和描述图像中的显著区域。当描述由单个词组成时,密集字幕任务推广了目标检测;当预测区域覆盖全图时,它推广了图像字幕。为了联合解决定位和描述任务,我们提出了一种全卷积定位网络(FCLN)架构,该架构通过单次高效前向传播处理图像,不需要外部区域提议,并且可以通过单轮优化端到端训练。该架构由卷积网络、新颖的密集定位层和生成标签序列的循环神经网络语言模型组成。我们在Visual Genome数据集上评估我们的网络,该数据集包含94,000张图像和4,100,000个区域依据字幕。我们观察到在生成和检索设置下,相对于基于当前最先进方法的基线,速度和精度均有提升。

关键词

引用

@article{arxiv.1511.07571,
  title  = {DenseCap: Fully Convolutional Localization Networks for Dense Captioning},
  author = {Justin Johnson and Andrej Karpathy and Li Fei-Fei},
  journal= {arXiv preprint arXiv:1511.07571},
  year   = {2015}
}