利用综合图像-语言线索的短语定位与视觉关系检测
计算机视觉与模式识别
2017-08-10 v4
摘要
本文提出了一个利用大量语言和视觉线索进行图像中短语定位或grounding的框架。我们对实体边界框的外观、尺寸和位置,包含属性信息的形容词,以及由动词或介词连接的实体对之间的空间关系进行了建模。我们特别关注人与服装或身体部位提及之间的关系,因为这对于区分个体非常有用。我们自动学习组合这些线索的权重,并在测试时对描述中的所有短语进行联合推断。由此产生的系统在Flickr30k Entities数据集上的短语定位和Stanford VRD数据集上的视觉关系检测中取得了state of the art的性能。
引用
@article{arxiv.1611.06641,
title = {Phrase Localization and Visual Relationship Detection with Comprehensive Image-Language Cues},
author = {Bryan A. Plummer and Arun Mallya and Christopher M. Cervantes and Julia Hockenmaier and Svetlana Lazebnik},
journal= {arXiv preprint arXiv:1611.06641},
year = {2017}
}
备注
IEEE ICCV 2017 accepted paper