中文

半自回归图像描述生成

计算机视觉与模式识别 2021-10-14 v2

摘要

当前最先进的图像描述生成方法通常采用自回归方式,即逐词生成描述,这存在解码缓慢问题并成为实时应用中的瓶颈。具有连续迭代精炼的非自回归图像描述生成消除了句子生成中的顺序依赖,能以可观的加速取得与自回归方法相当的性能。然而,基于精心设计的实验,我们经验性地证明当为语言解码器提供充分先验知识时,迭代次数可被有效减少。为此,我们提出一种新颖的两阶段框架,称为半自回归图像描述生成(SAIC),以在性能与速度间取得更好权衡。所提 SAIC 模型在全局保持自回归特性但在局部缓解该特性。具体而言,SAIC 模型首先以自回归方式跳跃式生成间歇序列,即依次预测每个词组中的首个词。然后,借助部分确定性先验信息与图像特征,SAIC 模型以一次迭代非自回归地填充所有被跳过的词。在 MS COCO 基准上的实验结果表明,我们的 SAIC 模型优于先前非自回归图像描述生成模型,同时获得了具竞争力的推理加速。代码见 https://github.com/feizc/SAIC。

关键词

引用

@article{arxiv.2110.05342,
  title  = {Semi-Autoregressive Image Captioning},
  author = {Xu Yan and Zhengcong Fei and Zekang Li and Shuhui Wang and Qingming Huang and Qi Tian},
  journal= {arXiv preprint arXiv:2110.05342},
  year   = {2021}
}

备注

ACM MM2021 Oral