中文

用于图像描述的堆叠跨模态特征融合注意力网络

计算机视觉与模式识别 2024-04-10 v1 图像与视频处理

摘要

近来,注意力增强的编码器-解码器框架因其在图像描述上的巨大进展而引起广泛关注。许多视觉注意力模型直接利用有意义区域来生成图像描述。然而,寻求从视觉空间到文本的直接转换不足以生成细粒度描述。本文利用一种特征复合方法,以完全端到端的方式将高层语义概念与关于上下文环境的视觉信息结合在一起。为此,我们提出一种用于图像描述的堆叠跨模态特征融合(SCFC)注意力网络,其中我们通过一种新颖的复合函数以多步推理方式同时融合跨模态特征。此外,我们将空间信息与上下文感知属性(CAA)共同作为所提复合函数的主要组成部分,其中CAA提供了简洁的上下文敏感语义表示。为更好地利用融合特征的潜力,我们进一步提出SCFC-LSTM作为描述生成器,其可在描述生成过程中利用判别性语义信息。实验结果表明,在MSCOCO和Flickr30K数据集上,我们提出的SCFC在常用指标方面优于多种最先进的图像描述基准。

关键词

引用

@article{arxiv.2302.04676,
  title  = {Stacked Cross-modal Feature Consolidation Attention Networks for Image Captioning},
  author = {Mozhgan Pourkeshavarz and Shahabedin Nabavi and Mohsen Ebrahimi Moghaddam and Mehrnoush Shamsfard},
  journal= {arXiv preprint arXiv:2302.04676},
  year   = {2024}
}