中文

一种基于注意力机制的集成模型用于图像描述

计算机视觉与模式识别 2025-01-28 v1 人工智能

摘要

图像描述通过建立词语与图像实际内容之间的关系,从输入图像生成信息性文本。近年来,利用Transformer的深度学习模型在自动生成图像描述方面最为成功。Transformer网络的能力推动了多项视觉相关活动的显著进展。本文深入研究了Transformer模型,重点强调了注意力机制所起的关键作用。所提出的模型使用Transformer编码器-解码器架构生成文本描述,并使用深度学习卷积神经网络从图像中提取特征。为生成描述,我们提出了一种新颖的集成学习框架,该框架利用多种深度神经网络架构,并基于一种投票机制,选择具有最高双语评估替补(BLEU)分数的描述,从而提高了生成描述的丰富性。使用公开数据集对所提出的模型进行了评估。在Flickr8K数据集上,该模型取得了最高的BLEU-[1-3]分数,分别为0.728、0.495和0.323。在Flickr30k数据集上,根据BLEU-[1-4]分数,所建议的模型优于最新方法,分数分别为0.798、0.561、0.387和0.269。模型效能也通过语义命题图像描述评估(SPICE)指标获得,Flicker8k数据集的评分为0.164,Flicker30k数据集为0.387。最后,集成学习显著推进了图像描述过程,因此可在不同领域的各种应用中加以利用。

关键词

引用

@article{arxiv.2501.14828,
  title  = {An Ensemble Model with Attention Based Mechanism for Image Captioning},
  author = {Israa Al Badarneh and Bassam Hammo and Omar Al-Kadi},
  journal= {arXiv preprint arXiv:2501.14828},
  year   = {2025}
}

备注

35 pages, 10 figures, 4 tables