中文

重新思考图像描述中潜状态的形式

计算机视觉与模式识别 2018-08-15 v1 机器学习 机器学习

摘要

RNN 及其变体已被广泛采用用于图像描述。在 RNN 中,描述文本的生成由一系列潜状态驱动。现有描述模型通常将潜状态表示为向量,并想当然地采用这一做法。我们重新审视这一选择并研究一种替代公式,即使用二维图来编码潜状态。其动机源于一个好奇的问题:潜状态中的空间结构如何影响最终的描述?我们在 MSCOCO 和 Flickr30k 上的研究得出两个重要观察。首先,采用 2D 状态的公式在描述任务中普遍更有效,在参数量可比的情况下持续取得更高性能。其次,2D 状态保留了空间局部性。利用这一点,我们可视化地揭示了描述生成过程的内部动态,以及输入视觉域与输出语言域之间的联系。

关键词

引用

@article{arxiv.1807.09958,
  title  = {Rethinking the Form of Latent States in Image Captioning},
  author = {Bo Dai and Deming Ye and Dahua Lin},
  journal= {arXiv preprint arXiv:1807.09958},
  year   = {2018}
}

备注

ECCV 2018, first two authors contribute equally