中文

基于深度_CNN_与双向门控循环单元的图像到孟加拉语字幕生成

计算机视觉与模式识别 2020-12-23 v1 机器学习

摘要

关于生成孟加拉语描述的研究甚少。约 2.43 亿人使用孟加拉语,它是地球上第 7 大通用语言。本研究的目的是提出一种基于_CNN_和双向_GRU_的架构模型,从图像生成孟加拉语的自然语言字幕。孟加拉语使用者可利用本研究打破语言障碍,更好地理解彼此的视角。它也将帮助许多盲人的日常生活。本文采用编码器-解码器方法生成字幕。我们使用名为_InceptionV3_图像嵌入模型的预训练深度卷积神经网络(DCNN)作为编码器,用于数据集图像的分析、分类与标注;使用双向门控循环单元(BGRU)层作为解码器生成字幕。采用_Argmax_和集束搜索以产生尽可能高质量的字幕。使用了一个名为_BNATURE_的新数据集,包含 8000 张图像,每张图像有五条字幕。该数据集用于训练和测试所提模型。我们获得的_BLEU-1_、_BLEU-2_、_BLEU-3_、_BLEU-4_和_Meteor_分别为 42.6、27.95、23.66、16.41、28.7。

关键词

引用

@article{arxiv.2012.12139,
  title  = {Image to Bengali Caption Generation Using Deep CNN and Bidirectional Gated Recurrent Unit},
  author = {Al Momin Faruk and Hasan Al Faraby and Md. Muzahidul Azad and Md. Riduyan Fedous and Md. Kishor Morol},
  journal= {arXiv preprint arXiv:2012.12139},
  year   = {2020}
}

备注

Accepted at ICCIT2020