用于图像描述的几何纠缠视觉语义 Transformer
计算机视觉与模式识别
2021-09-30 v1
摘要
图像描述的最新进展主要体现为视觉-语义融合或几何辅助的注意力精炼。然而,这些基于融合的模型仍因缺乏用于内部和跨部注意力精炼的几何信息而受到批评。另一方面,基于几何辅助注意力的模型仍受视觉与语义信息之间模态鸿沟的困扰。本文引入一种新颖的几何纠缠视觉语义 Transformer (GEVST) 网络,以实现视觉-语义融合与几何辅助注意力精炼的互补优势。具体而言,首先由 Dense-Cap 模型提出一些带有对应几何信息的密集描述。然后,为赋予 GEVST 桥接视觉与语义信息间模态鸿沟的能力,我们构建了四个并行的 Transformer 编码器:VV(纯视觉)、VS(语义融合至视觉)、SV(视觉融合至语义)和 SS(纯语义),用于最终的描述生成。视觉和语义几何特征均被用于融合模块和自注意力模块中,以实现更好的注意力度量。为验证我们的模型,我们在 MS-COCO 数据集上进行了大量实验,实验结果表明我们的 GEVST 模型能获得有前景的性能提升。
引用
@article{arxiv.2109.14137,
title = {Geometry-Entangled Visual Semantic Transformer for Image Captioning},
author = {Ling Cheng and Wei Wei and Feida Zhu and Yong Liu and Chunyan Miao},
journal= {arXiv preprint arXiv:2109.14137},
year = {2021}
}