通过利用 Transformer 网络中层内与层间全局表示改进图像描述生成
计算机视觉与模式识别
2020-12-15 v1
摘要
基于 Transformer 的架构在图像描述生成中已显示出巨大成功,其中对象区域被编码并随后被注意力机制融入向量表示以引导描述解码。然而,此类向量表示仅包含区域级信息,未考虑反映整幅图像的全局信息,难以拓展图像描述生成中复杂多模态推理的能力。本文中,我们引入一种全局增强 Transformer(称为 GET)以实现更全面的全局表示的提取,并自适应引导解码器生成高质量描述。在 GET 中,设计了全局增强编码器用于全局特征的嵌入,并设计了全局自适应解码器用于描述生成的引导。前者利用所提出的全局增强注意力与层间融合模块建模层内与层间全局表示。后者包含可自适应将全局信息融合进解码器以引导描述生成的全局自适应控制器。在 MS COCO 数据集上的大量实验证明了我们的 GET 相对于许多 SOTA 方法的优越性。
引用
@article{arxiv.2012.07061,
title = {Improving Image Captioning by Leveraging Intra- and Inter-layer Global Representation in Transformer Network},
author = {Jiayi Ji and Yunpeng Luo and Xiaoshuai Sun and Fuhai Chen and Gen Luo and Yongjian Wu and Yue Gao and Rongrong Ji},
journal= {arXiv preprint arXiv:2012.07061},
year = {2020}
}
备注
Accepted at AAAI 2021 (preprint version)