均值框池化:Visual Madlibs 任务的丰富图像表示与输出嵌入
计算机视觉与模式识别
2016-08-10 v1 人工智能
计算与语言
机器学习
摘要
我们提出了均值框池化 (Mean Box Pooling),这是一种新颖的视觉表示方法,它对大量高度重叠的对象提议的 CNN 表示进行池化。我们表明,这种表示与 nCCA(一种成功的多模态嵌入技术)相结合,在 Visual Madlibs 任务上实现了最先进的性能。此外,受 nCCA 目标函数的启发,我们扩展了经典的 CNN+LSTM 方法,通过直接最大化深度学习架构的内部表示与候选答案之间的相似度来训练网络。同样,这种方法在 Visual Madlibs 任务上相比之前也使用 CNN+LSTM 方法的工作取得了显著改进。
引用
@article{arxiv.1608.02717,
title = {Mean Box Pooling: A Rich Image Representation and Output Embedding for the Visual Madlibs Task},
author = {Ashkan Mokarian and Mateusz Malinowski and Mario Fritz},
journal= {arXiv preprint arXiv:1608.02717},
year = {2016}
}
备注
Accepted to BMVC'16