利用神经场景图生成器学习视觉关系先验用于图文匹配与图像描述
计算机视觉与模式识别
2019-09-27 v1 人工智能
摘要
将语言锚定到视觉关系对各种语言与视觉应用至关重要。本工作中,我们处理两个基础的语言与视觉任务:图文匹配和图像描述,并证明神经场景图生成器能够学习有效的视觉关系特征,以促进语言到视觉关系的锚定,进而改进这两个终端应用。通过将关系特征与最先进模型结合,我们的实验在标准 Flickr30K 和 MSCOCO 基准上显示出显著提升。我们的实验结果与分析表明,关系特征提升了下游模型在终端视觉与语言应用中捕捉视觉关系的能力。我们还展示了学习与终端应用视觉相关的场景图生成器对关系特征有效性的重要性。
引用
@article{arxiv.1909.09953,
title = {Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators},
author = {Kuang-Huei Lee and Hamid Palangi and Xi Chen and Houdong Hu and Jianfeng Gao},
journal= {arXiv preprint arXiv:1909.09953},
year = {2019}
}