端到端图像描述利用多模态分布相似性
计算机视觉与模式识别
2018-09-13 v1
摘要
我们假设端到端神经图像描述系统之所以表现看似良好,是因为它们通过在多模态特征空间中将测试图像映射到该空间中相似训练图像,并从同一空间生成描述,从而利用并学习了该空间中的“分布相似性”。为验证此假设,我们聚焦于图像描述的“图像”侧,在保持 CNN-RNN 模型的 RNN 文本生成组件不变的前提下改变输入图像表示。我们的分析表明,图像描述模型(i)能够从含噪输入表示中分离出结构;(ii)当高维表示被压缩至低维空间时,几乎无显著性能损失;(iii)将具有相似视觉与语言信息的图像聚在一起。我们的发现表明分布相似性假设成立。我们得出结论:无论使用何种图像表示,图像描述系统似乎都在学习到的联合图像-文本语义子空间中匹配图像并生成描述。
引用
@article{arxiv.1809.04144,
title = {End-to-end Image Captioning Exploits Multimodal Distributional Similarity},
author = {Pranava Madhyastha and Josiah Wang and Lucia Specia},
journal= {arXiv preprint arXiv:1809.04144},
year = {2018}
}
备注
Published in BMVC 2018