中文

图像描述生成器中图像应置于何处

神经与进化计算 2018-03-15 v2 计算与语言 计算机视觉与模式识别

摘要

当使用循环神经网络语言模型进行描述生成时,图像信息可通过直接将其纳入 RNN(即通过“注入”图像特征来条件化语言模型)的方式,或通过 RNN 之后的一层(即通过“合并”图像特征来条件化语言模型)的方式输入神经网络。尽管文献中两种方案均有佐证,但迄今尚无两者间的系统比较。本文通过实证表明,采用何种架构对性能并无特别损害。合并架构确实具有实际优势,因为通过合并进行条件化可使 RNN 的隐藏状态向量尺寸缩减至多四倍。我们的结果表明,用于描述生成的视觉与语言模态不必由 RNN 联合编码,因为这会产生庞大且耗费内存的模型而在性能上鲜有切实优势;相反,多模态融合应推迟至后续阶段。

关键词

引用

@article{arxiv.1703.09137,
  title  = {Where to put the Image in an Image Caption Generator},
  author = {Marc Tanti and Albert Gatt and Kenneth P. Camilleri},
  journal= {arXiv preprint arXiv:1703.09137},
  year   = {2018}
}

备注

Accepted in JNLE Special Issue: Language for Images (24.3) (expanded with content that was removed from journal paper in order to reduce number of pages), 28 pages, 5 figures, 6 tables