中文

预训练 CNN 与基于 GRU 的注意力用于图像描述生成的比较研究

计算机视觉与模式识别 2023-10-12 v1 机器学习

摘要

图像描述生成是一项具有挑战性的任务,涉及利用计算机视觉与自然语言处理技术为图像生成文本描述。本文提出一种使用基于 GRU 的注意力机制进行图像描述生成的深度神经框架。我们的方法采用多个预训练卷积神经网络作为编码器从图像提取特征,并采用基于 GRU 的语言模型作为解码器生成描述性句子。为提升性能,我们将 Bahdanau 注意力模型与 GRU 解码器相整合,以学习聚焦于图像特定部分。我们使用 MSCOCO 与 Flickr30k 数据集评估我们的方法,并表明其相较于最优方法取得了有竞争力的分数。我们提出的框架可弥合计算机视觉与自然语言之间的鸿沟,并可扩展至特定领域。

关键词

引用

@article{arxiv.2310.07252,
  title  = {A Comparative Study of Pre-trained CNNs and GRU-Based Attention for Image Caption Generation},
  author = {Rashid Khan and Bingding Huang and Haseeb Hassan and Asim Zaman and Zhongfu Ye},
  journal= {arXiv preprint arXiv:2310.07252},
  year   = {2023}
}

备注

15pages, 10 figures, 5 tables. 2023 the 5th International Conference on Robotics and Computer Vision (ICRCV 2023). arXiv admin note: substantial text overlap with arXiv:2203.01594