神经双生对话
计算机视觉与模式识别
2021-08-21 v1
摘要
受人类大脑在增加对某一主体的关注时会启用更多神经通路这一机制的启发,我们引入了一种新颖的双级联注意力模型,其性能优于最初采用单通道注意力完成视觉定位任务的最先进图像字幕模型。视觉定位确保字幕句子中存在被锚定到输入图像特定区域的词。在深度学习模型于视觉定位任务上训练完毕后,该模型在生成字幕时会运用所习得的关于视觉定位及字幕句子中物体顺序的模式。我们报告了在COCO数据集上三个图像字幕任务的实验结果,并使用标准图像字幕指标展示本模型相较先前模型所取得的改进。实验结果表明,在深度神经网络中采用更多并行注意力通路可带来更高性能。我们对NTT的实现已公开于:https://github.com/zanyarz/NeuralTwinsTalk。
引用
@article{arxiv.2009.12524,
title = {Neural Twins Talk},
author = {Zanyar Zohourianshahzadi and Jugal Kumar Kalita},
journal= {arXiv preprint arXiv:2009.12524},
year = {2021}
}