中文

面向更优接地图像字幕的共识图表示学习

计算机视觉与模式识别 2022-04-14 v2 人工智能 计算与语言

摘要

当代视觉字幕模型常因视觉误分类或过度依赖先验而产生场景中并不存在的物体幻觉,导致视觉信息与目标词汇间的语义不一致。最常见的方法是促使字幕模型将生成的物体词或短语动态链接到图像适当区域,即接地图像字幕(GIC)。然而,GIC 利用一个辅助任务(物体接地)并未解决物体幻觉的关键问题,即语义不一致。本文对上述问题的视角新颖——利用视觉与语言模态间的语义连贯性。具体而言,我们提出用于 GIC 的共识图表示学习框架(CGRL),将共识表示引入接地字幕流程。该共识通过对齐视觉图(如场景图)与考虑图中节点与边的语言图来学习。借助对齐的共识,字幕模型可同时捕捉正确的语言特征与视觉相关性,进而进一步接地适当的图像区域。我们在 Flickr30k Entities 数据集上验证了模型有效性,物体幻觉显著下降(-9% CHAIRi)。此外,我们的 CGRL 还通过若干自动指标与人工评估进行评价,结果表明所提方法可同时提升图像字幕性能(+2.9 Cider)与接地性能(+2.3 F1LOC)。

关键词

引用

@article{arxiv.2112.00974,
  title  = {Consensus Graph Representation Learning for Better Grounded Image Captioning},
  author = {Wenqiao Zhang and Haochen Shi and Siliang Tang and Jun Xiao and Qiang Yu and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2112.00974},
  year   = {2022}
}

备注

9 pages, 5 figures, AAAI 2021