将图像描述作为 SOCKEYE 中的神经机器翻译任务
计算机视觉与模式识别
2018-10-16 v3
摘要
图像描述是一个介于计算机视觉与自然语言处理之间的跨学科研究问题。其任务是生成对图像内容的文本描述。用于图像描述的典型模型是编码器-解码器深度网络,其中编码器捕捉图像的本质,而解码器负责生成描述图像的句子。注意力机制可用于自动将解码器聚焦于与预测下一个词相关的图像部分。在本文中,我们探索神经机器翻译中流行的不同解码器与注意力模型,即注意力循环神经网络、自注意力 Transformer 以及全卷积网络,它们代表了神经机器翻译的当前最优水平。图像描述模块作为 SOCKEYE 的一部分提供,地址为 https://github.com/awslabs/sockeye,其教程可在 https://awslabs.github.io/sockeye/image_captioning.html 找到。
引用
@article{arxiv.1810.04101,
title = {Image Captioning as Neural Machine Translation Task in SOCKEYE},
author = {Loris Bazzani and Tobias Domhan and Felix Hieber},
journal= {arXiv preprint arXiv:1810.04101},
year = {2018}
}