图像描述生成器中图像应置于何处
神经与进化计算
2018-03-15 v2 计算与语言
计算机视觉与模式识别
摘要
当使用循环神经网络语言模型进行描述生成时,图像信息可通过直接将其纳入 RNN(即通过“注入”图像特征来条件化语言模型)的方式,或通过 RNN 之后的一层(即通过“合并”图像特征来条件化语言模型)的方式输入神经网络。尽管文献中两种方案均有佐证,但迄今尚无两者间的系统比较。本文通过实证表明,采用何种架构对性能并无特别损害。合并架构确实具有实际优势,因为通过合并进行条件化可使 RNN 的隐藏状态向量尺寸缩减至多四倍。我们的结果表明,用于描述生成的视觉与语言模态不必由 RNN 联合编码,因为这会产生庞大且耗费内存的模型而在性能上鲜有切实优势;相反,多模态融合应推迟至后续阶段。
引用
@article{arxiv.1703.09137,
title = {Where to put the Image in an Image Caption Generator},
author = {Marc Tanti and Albert Gatt and Kenneth P. Camilleri},
journal= {arXiv preprint arXiv:1703.09137},
year = {2018}
}
备注
Accepted in JNLE Special Issue: Language for Images (24.3) (expanded with content that was removed from journal paper in order to reduce number of pages), 28 pages, 5 figures, 6 tables