用于图像字幕的半自回归 Transformer
计算机视觉与模式识别
2021-08-18 v2
摘要
当前最先进的图像字幕模型采用自回归解码器,即它们通过以先前生成的词为条件来生成每个词,这导致推理期间的高延迟。为解决此问题,近期提出了非自回归图像字幕模型,通过并行生成所有词来显著加速推理速度。然而,这些非自回归模型不可避免地遭受较大的生成质量下降,因为它们过度去除了词依赖。为了在速度与质量之间做出更好权衡,我们引入了用于图像字幕的半自回归模型(称为 SATIC),它在全局上保持自回归特性,但在局部并行生成词。基于 Transformer,只需少量修改即可实现 SATIC。在 MSCOCO 图像字幕基准上的实验结果表明,SATIC 无需额外技巧即可实现良好的权衡。代码可在 {\color{magenta}\url{https://github.com/YuanEZhou/satic}} 获取。
引用
@article{arxiv.2106.09436,
title = {Semi-Autoregressive Transformer for Image Captioning},
author = {Yuanen Zhou and Yong Zhang and Zhenzhen Hu and Meng Wang},
journal= {arXiv preprint arXiv:2106.09436},
year = {2021}
}
备注
Revised