中文

在无定位监督下学习生成有依据的可视化描述

计算机视觉与模式识别 2020-07-21 v3 计算与语言 机器学习

摘要

当为图像或视频自动生成句子描述时,通常仍不清楚生成的描述在多大程度上是有依据的(grounded),即模型是否使用了正确的图像区域来输出特定单词,还是模型基于数据集和/或语言模型中的先验进行幻觉生成。在描述模型中将图像区域与单词关联的最常见方式是通过对区域施加注意力机制,这些区域被用作预测下一个词的输入。因此,模型必须在不知道其应定位的单词的情况下学习预测注意力权重。由于缺乏依据监督,这很难训练,因为循环模型可以传播过去的信息,并且没有显式信号迫使描述生成模型正确地对各个解码出的单词进行依据定位。在本工作中,我们通过一种新颖的循环训练机制帮助模型实现这一点,该机制在句子解码器生成每个单词后迫使模型在图像中定位该单词,然后从定位到的图像区域重建句子以匹配真实标注。我们提出的框架仅需学习一个额外的全连接层(定位器),该层在测试时可被移除。我们表明,对于图像和视频描述任务,我们的模型在不依赖依据监督且不在推理时引入额外计算的情况下,显著提高了定位准确性。代码可在 https://github.com/chihyaoma/cyclical-visual-captioning 获取。

关键词

引用

@article{arxiv.1906.00283,
  title  = {Learning to Generate Grounded Visual Captions without Localization Supervision},
  author = {Chih-Yao Ma and Yannis Kalantidis and Ghassan AlRegib and Peter Vajda and Marcus Rohrbach and Zsolt Kira},
  journal= {arXiv preprint arXiv:1906.00283},
  year   = {2020}
}

备注

ECCV 2020. Code is available at https://github.com/chihyaoma/cyclical-visual-captioning