基于深度学习的图像描述生成的实证分析
计算机视觉与模式识别
2021-05-25 v2
摘要
自动图像描述生成是深度学习的应用之一,涉及计算机视觉与自然语言处理工作的融合,通常使用编码器-解码器架构完成。在本项目中,我们实现并实验了多种多模态图像描述生成网络,探索了基于ResNet101、DenseNet121和VGG19的CNN编码器与基于注意力的LSTM解码器。我们研究了束搜索大小与预训练词嵌入的使用效果,并将其与基线CNN编码器和RNN解码器架构比较。目标是通过包括BLEU、CIDEr、ROUGE和METEOR在内的多种评估指标分析各方法的性能。我们还使用视觉注意力图(VAM)探索了模型可解释性,以高亮图像中对生成描述中每个词预测贡献最大的部分。
引用
@article{arxiv.2105.09906,
title = {Empirical Analysis of Image Caption Generation using Deep Learning},
author = {Aditya Bhattacharya and Eshwar Shamanna Girishekar and Padmakar Anil Deshpande},
journal= {arXiv preprint arXiv:2105.09906},
year = {2021}
}
备注
Withdrawing for further updates to the work