中文

用于图像描述的具有几何相干物体的标签注意力 Transformer

计算机视觉与模式识别 2021-09-17 v1 人工智能

摘要

对图像与视频中场景理解进行自动转写是迈向通用人工智能的一步。图像描述是指利用计算机视觉技术描述图像中有意义信息的术语。自动化图像描述技术采用编码器-解码器架构,其中编码器从图像中提取特征,解码器生成转写文本。本工作中,我们探究两种未见于图像描述 Transformer 研究的思路:第一,我们展示利用物体在其周围环境中的相关性;第二,学习标签与语言结构之间的显式关联。我们提出具有几何相干物体的标签注意力 Transformer(LATGeO)。所提技术利用深度神经网络(DNN)获取几何相干物体的候选框,并通过标签注意力模块考察其关系以生成描述。物体相干性由候选框几何属性的局部化比率定义。标签注意力模块利用自注意力层将提取的物体类别与可用词典相关联。实验结果表明,环境中物体的相关性及其视觉特征与几何局部化比率的结合,并绑定相应标签,有助于定义有意义的描述。所提框架在 MSCOCO 数据集上测试,充分评估得出的整体更优量化分数表明了其优越性。

关键词

引用

@article{arxiv.2109.07799,
  title  = {Label-Attention Transformer with Geometrically Coherent Objects for Image Captioning},
  author = {Shikha Dubey and Farrukh Olimov and Muhammad Aasim Rafique and Joonmo Kim and Moongu Jeon},
  journal= {arXiv preprint arXiv:2109.07799},
  year   = {2021}
}