CPTR:用于图像描述的全Transformer网络
计算机视觉与模式识别
2021-01-29 v3
摘要
在本文中,我们从新的序列到序列预测视角考虑图像描述任务,并提出Caption Transformer(CPTR),其将序列化原始图像作为Transformer的输入。与“CNN+Transformer”设计范式相比,我们的模型从一开始就能在每个编码器层建模全局上下文,并且完全无卷积。大量实验证明了所提模型的有效性,并且我们在MSCOCO数据集上超越了常规的“CNN+Transformer”方法。此外,得益于全Transformer架构,我们提供了编码器中块间自注意力以及解码器中“词到块”注意力的详细可视化。
引用
@article{arxiv.2101.10804,
title = {CPTR: Full Transformer Network for Image Captioning},
author = {Wei Liu and Sihan Chen and Longteng Guo and Xinxin Zhu and Jing Liu},
journal= {arXiv preprint arXiv:2101.10804},
year = {2021}
}