中文

Neural Baby Talk

计算机视觉与模式识别 2018-03-28 v1 计算与语言

摘要

我们提出了一种新颖的图像描述生成框架,该框架能够生成明确基于目标检测器在图像中发现的实体的自然语言。我们的方法将经典的槽填充方法(通常在图像中具有更好的基础)与现代神经描述生成方法(通常听起来更自然且更准确)相协调。我们的方法首先生成一个句子“模板”,其槽位置明确绑定到特定的图像区域。然后,这些槽由目标检测器在这些区域中识别出的视觉概念进行填充。整个架构(句子模板生成和使用目标检测器进行槽填充)是端到端可微的。我们在不同的图像描述生成任务上验证了所提模型的有效性。在标准图像描述生成和新颖物体描述生成任务上,我们的模型在 COCO 和 Flickr30k 数据集上均达到了 SOTA。我们还证明,当场景组成的训练和测试分布(以及相关描述的语言先验)不同时,我们的模型具有独特的优势。代码已发布于:https://github.com/jiasenlu/NeuralBabyTalk

关键词

引用

@article{arxiv.1803.09845,
  title  = {Neural Baby Talk},
  author = {Jiasen Lu and Jianwei Yang and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:1803.09845},
  year   = {2018}
}

备注

12 pages, 7 figures, CVPR 2018