基于深度卷积神经网络编码-解码模型的改进孟加拉语图像描述生成
计算机视觉与模式识别
2021-02-16 v1
摘要
图像描述生成是一项艰巨的任务,即用与图像相关的自然语言产生句法和语义正确的图像文本描述。现有的孟加拉语图像描述生成(BIC) notable 研究均基于编码-解码架构。本文提出了一种端到端图像描述系统,利用多模态架构,将一维卷积神经网络(CNN)用于编码序列信息,并与预训练的 ResNet-50 模型图像编码器结合以提取基于区域视觉特征。我们在 BanglaLekhaImageCaptions 数据集上使用现有评价指标考察了方法的性能,并进行了人工评价以作定性分析。实验表明,我们的语言编码器捕获了描述中的细粒度信息,并与图像特征结合生成准确且多样的描述。我们的工作优于所有现有 BIC 工作,并在 BLUE-1 上取得 0.651、CIDEr 上 0.572、METEOR 上 0.297、ROUGE 上 0.434、SPICE 上 0.357 的分数,达到了新的 state-of-the-art (SOTA) 性能。
引用
@article{arxiv.2102.07192,
title = {Improved Bengali Image Captioning via deep convolutional neural network based encoder-decoder model},
author = {Mohammad Faiyaz Khan and S. M. Sadiq-Ur-Rahman Shifath and Md. Saiful Islam},
journal= {arXiv preprint arXiv:2102.07192},
year = {2021}
}
备注
Accepted in "IJCACI 2020: International Joint Conference on Advances in Computational Intelligence"