中文

面向弱监督接地图像字幕的自顶向下框架

计算机视觉与模式识别 2024-03-05 v3

摘要

弱监督接地图像字幕(WSGIC)旨在不使用边界框监督的情况下生成字幕并在输入图像中定位(ground)所预测的物体词。近期的两阶段方案多采用自底向上流程:(1)使用物体检测器将输入图像编码为多个区域特征;(2)利用区域特征进行字幕生成与接地。然而,利用物体检测器生成的独立候选框往往使后续的接地字幕生成器过拟合于寻找正确物体词,忽视物体间关系,并为接地选择不兼容的候选区域。为解决这些问题,我们提出一种单阶段弱监督接地字幕生成器,其直接以 RGB 图像作为输入,在自顶向下的图像层级执行字幕生成与接地。具体而言,我们将图像编码为视觉词元表示,并在解码器中提出循环接地模块(RGM)以获得精确的视觉语言注意力图(VLAMs),从而识别物体的空间位置。此外,我们显式地将关系模块注入单阶段框架,通过多标签分类促进关系理解。该关系语义作为上下文信息,辅助字幕中关系词与物体词的预测。我们观察到,关系语义不仅协助接地字幕生成器生成更准确的字幕,还提升了接地性能。我们在两个具有挑战性的数据集(Flickr30k Entities captioning 与 MSCOCO captioning)上验证了所提方法的有效性。实验结果表明,我们的方法取得了最先进的接地性能。

关键词

引用

@article{arxiv.2306.07490,
  title  = {Top-Down Framework for Weakly-supervised Grounded Image Captioning},
  author = {Chen Cai and Suchen Wang and Kim-hui Yap and Yi Wang},
  journal= {arXiv preprint arXiv:2306.07490},
  year   = {2024}
}