中文

长度可控的图像描述生成

计算机视觉与模式识别 2020-07-21 v1 计算与语言 机器学习

摘要

过去十年中图像描述任务取得了显著进展;然而,大多数现有方法无法控制其描述,\emph{例如}选择粗略或详细地描述图像。本文提出使用一种简单的长度级别嵌入来赋予它们这种能力。此外,由于其自回归特性,现有模型的计算复杂度随生成描述长度线性增长。因此,我们进一步设计了一种非自回归图像描述方法,能以与长度无关的复杂度生成描述。我们在三个模型上验证了所提长度级别嵌入的优越性:两个具有不同类型解码器的 SOTA(当前最佳)自回归模型,以及我们提出的非自回归模型,以展示其泛化能力。实验中,我们的长度可控图像描述模型不仅在具有挑战性的 MS COCO 数据集上取得了 SOTA 性能,还生成了长度可控且多样的图像描述。具体而言,我们的非自回归模型在可控性和多样性方面优于自回归基线,并显著提升了长描述的解码效率。我们的代码和模型发布于 \textcolor{magenta}{\texttt{https://github.com/bearcatt/LaBERT}}。

关键词

引用

@article{arxiv.2007.09580,
  title  = {Length-Controllable Image Captioning},
  author = {Chaorui Deng and Ning Ding and Mingkui Tan and Qi Wu},
  journal= {arXiv preprint arXiv:2007.09580},
  year   = {2020}
}

备注

To be appeared in ECCV 2020