为图像字幕中的场景图辩护
计算机视觉与模式识别
2021-08-18 v3 计算与语言
摘要
主流图像字幕模型依赖卷积神经网络(CNN)图像特征,通过循环模型生成字幕。近来,图像场景图被用于增强字幕模型,以利用其结构语义,如对象实体、关系与属性。若干研究指出,直接采用黑盒场景图生成器得到的场景图会损害图像字幕性能,且基于场景图的字幕模型必须显式使用图像特征开销才能生成像样的字幕。针对这些挑战,我们提出\textbf{SG2Caps},一种仅利用场景图标签即可取得有竞争力图像字幕性能的框架。其基本思想是缩小两个场景图之间的语义鸿沟——一个由输入图像导出,另一个由其字幕导出。为此,我们利用对象的空间位置与人-物交互(HOI)标签作为额外的HOI图。SG2Caps以较大优势超越现有仅用场景图的字幕模型,表明场景图是图像字幕的一种有前景的表示。直接利用场景图标签避免了在高维CNN特征上的昂贵图卷积,从而减少了49%的可训练参数。我们的代码见:https://github.com/Kien085/SG2Caps
引用
@article{arxiv.2102.04990,
title = {In Defense of Scene Graphs for Image Captioning},
author = {Kien Nguyen and Subarna Tripathi and Bang Du and Tanaya Guha and Truong Q. Nguyen},
journal= {arXiv preprint arXiv:2102.04990},
year = {2021}
}
备注
Accepted to ICCV 2021