中文

基于位置对齐的快速图像描述生成

计算机视觉与模式识别 2019-12-16 v1

摘要

近期用于图像描述生成的神经网络模型通常采用编码器-解码器架构,其中解码器采用递归序列解码方式。然而,这种自回归解码可能导致序列误差累积以及生成速度缓慢,从而限制了实际应用。非自回归(NA)解码已被提出以解决这些问题,但由于对目标分布的间接建模,其语言质量存在问题。为此,我们提出了一种改进的非自回归预测框架以加速图像描述生成。我们的解码部分包含一个位置对齐模块,用于对给定图像中检测到的内容描述词进行排序,以及一个精细的非自回归解码器以生成流畅的描述。此外,我们引入了一种推理策略,将位置信息视为潜变量来引导后续的句子生成。在公开数据集上的实验结果表明,与一般的非自回归描述模型相比,我们提出的模型取得了更好的性能,同时在显著加速的情况下达到了与自回归图像描述模型相当的性能。

关键词

引用

@article{arxiv.1912.06365,
  title  = {Fast Image Caption Generation with Position Alignment},
  author = {Zheng-cong Fei},
  journal= {arXiv preprint arXiv:1912.06365},
  year   = {2019}
}

备注

AAAI2020 oral presentation on workshop