基于位置对齐的快速图像描述生成
计算机视觉与模式识别
2019-12-16 v1
摘要
近期用于图像描述生成的神经网络模型通常采用编码器-解码器架构,其中解码器采用递归序列解码方式。然而,这种自回归解码可能导致序列误差累积以及生成速度缓慢,从而限制了实际应用。非自回归(NA)解码已被提出以解决这些问题,但由于对目标分布的间接建模,其语言质量存在问题。为此,我们提出了一种改进的非自回归预测框架以加速图像描述生成。我们的解码部分包含一个位置对齐模块,用于对给定图像中检测到的内容描述词进行排序,以及一个精细的非自回归解码器以生成流畅的描述。此外,我们引入了一种推理策略,将位置信息视为潜变量来引导后续的句子生成。在公开数据集上的实验结果表明,与一般的非自回归描述模型相比,我们提出的模型取得了更好的性能,同时在显著加速的情况下达到了与自回归图像描述模型相当的性能。
引用
@article{arxiv.1912.06365,
title = {Fast Image Caption Generation with Position Alignment},
author = {Zheng-cong Fei},
journal= {arXiv preprint arXiv:1912.06365},
year = {2019}
}
备注
AAAI2020 oral presentation on workshop