中文

用于图像描述的神经语言模型中纳入视觉信息的架构研究

神经与进化计算 2019-11-12 v1 计算与语言

摘要

神经语言模型可通过提供除句子前缀之外的视觉信息,被调节以生成图像描述。该视觉信息可通过不同的入口点纳入语言模型,从而形成不同的神经架构。我们确定了四种主要架构,分别称为init-inject、pre-inject、par-inject和merge。我们分析这四种架构并得出结论:性能最佳的是init-inject,即视觉信息被注入循环神经网络的初始状态。我们使用自动评价指标和人工标注证实了这一点。随后我们分析各架构受图像影响的程度。这是通过测量当部分句子与完全不同的图像(而非本应组合的图像)组合时,模型输出概率的差异程度来完成的。我们发现init-inject随着生成词数增多,受图像影响倾向于快速减弱。一种称为merge的不同架构,即在输出前将视觉信息与循环神经网络的隐藏状态向量合并,其视觉影响丧失得慢得多,表明它更适用于生成更长句子。我们还观察到merge架构的循环神经网络可进行纯文本语言模型下的预训练(迁移学习),而非像通常那样随机初始化。只要源语言模型不太擅长语言建模(否则会过度专门化且在图像描述生成上效果较差),这会带来优于其他架构的性能。我们的工作为神经架构、可解释AI和迁移学习的研究开辟了新途径。

关键词

引用

@article{arxiv.1911.03738,
  title  = {On Architectures for Including Visual Information in Neural Language Models for Image Description},
  author = {Marc Tanti and Albert Gatt and Kenneth P. Camilleri},
  journal= {arXiv preprint arXiv:1911.03738},
  year   = {2019}
}

备注

145 pages, 41 figures, 15 tables, Doctoral thesis