中文

场景图是否足以改进图像描述生成?

计算机视觉与模式识别 2020-10-28 v2 计算与语言

摘要

许多性能最佳的图像描述生成模型仅依赖目标检测模型计算出的目标特征来生成图像描述。然而,近期研究提出直接使用场景图将目标间关系信息引入描述生成,以期更好地刻画目标之间的交互。本文中,我们深入研究了场景图在图像描述生成中的使用。我们通过实证探究使用额外的场景图编码器能否带来更好的图像描述,并提出了一种条件图注意力网络(C-GAT),其中图像描述生成解码器状态被用于条件化图更新。最后,我们确定了预测场景图中的噪声在多大程度上影响描述质量。总体而言,我们发现使用场景图特征的模型与仅使用目标检测特征的模型在不同描述生成指标上无显著差异,这表明现有场景图生成模型噪声仍过大,难以在图像描述生成中发挥作用。此外,尽管预测场景图的整体质量很低,但当使用高质量场景图时,相较于强大的 Bottom-Up Top-Down 基线,我们获得了最高 3.3 CIDEr 的提升。我们在 https://github.com/iacercalixto/butd-image-captioning 开源了复现所有实验的代码。

关键词

引用

@article{arxiv.2009.12313,
  title  = {Are scene graphs good enough to improve Image Captioning?},
  author = {Victor Milewski and Marie-Francine Moens and Iacer Calixto},
  journal= {arXiv preprint arXiv:2009.12313},
  year   = {2020}
}

备注

Published at AACL-IJCNLP 2020. 12 pages, 5 figures