重新思考图像描述中潜状态的形式
计算机视觉与模式识别
2018-08-15 v1 机器学习
机器学习
摘要
RNN 及其变体已被广泛采用用于图像描述。在 RNN 中,描述文本的生成由一系列潜状态驱动。现有描述模型通常将潜状态表示为向量,并想当然地采用这一做法。我们重新审视这一选择并研究一种替代公式,即使用二维图来编码潜状态。其动机源于一个好奇的问题:潜状态中的空间结构如何影响最终的描述?我们在 MSCOCO 和 Flickr30k 上的研究得出两个重要观察。首先,采用 2D 状态的公式在描述任务中普遍更有效,在参数量可比的情况下持续取得更高性能。其次,2D 状态保留了空间局部性。利用这一点,我们可视化地揭示了描述生成过程的内部动态,以及输入视觉域与输出语言域之间的联系。
引用
@article{arxiv.1807.09958,
title = {Rethinking the Form of Latent States in Image Captioning},
author = {Bo Dai and Deming Ye and Dahua Lin},
journal= {arXiv preprint arXiv:1807.09958},
year = {2018}
}
备注
ECCV 2018, first two authors contribute equally