基于自然语言查询的零样本物体定位
计算机视觉与模式识别
2019-08-21 v1 计算与语言
摘要
短语定位系统用于在图像中定位由自然语言查询所指的特定物体。在以往工作中,短语中的名词被限制为训练时见过的词,我们将该任务扩展至零样本定位(Zero-Shot Grounding, ZSG),其可包含新颖的、“未见”的名词。当前的短语定位系统采用两阶段框架中的显式目标检测网络,其中一阶段生成稀疏候选框,另一阶段对其进行评估。在 ZSG 设定下,生成合适的候选框本身成为障碍,因为候选框生成器是在检测和定位数据集中常见的实体上训练的。我们提出了一种称为 ZSGNet 的新型单阶段模型,其将检测网络与定位系统相结合,并预测分类分数与回归参数。由于查询与已学类别之间关系的影响,ZSG 系统的评估带来额外的微妙之处;我们定义了四种包含不同难度级别的明确条件。我们还引入了从 Flickr30k Entities 和 Visual Genome 中下采样的新数据集,以支持对这四种条件的评估。我们的实验表明,ZSGNet 在常规的“已见”设定下于 Flickr30k 和 ReferIt 上达到了最先进的性能,并在零样本设定下显著优于基线。
引用
@article{arxiv.1908.07129,
title = {Zero-Shot Grounding of Objects from Natural Language Queries},
author = {Arka Sadhu and Kan Chen and Ram Nevatia},
journal= {arXiv preprint arXiv:1908.07129},
year = {2019}
}
备注
ICCV19 oral, camera-ready version