中文

OptiBox:打破视觉定位中候选框的局限

计算机视觉与模式识别 2019-12-03 v1

摘要

语言定位问题因其在更通用的图像-语言高层推理任务(如图像描述、VQA)中的关键作用,近年来备受关注。尽管视觉定位取得了巨大进展,多数方法的性能仍受限于近期所有流程早期阶段所获取边界框候选的质量。为应对此局限,我们提出一种通用的渐进式查询引导边界框精修架构(OptiBox),其利用全局图像编码以获取额外上下文。我们将该架构应用于 2016 年首次提出的 GroundeR 模型,该模型具有若干独特且吸引人的特性,例如能通过利用循环语言重建在半监督设定下学习。使用 GroundeR + OptiBox 以及我们提出的简单语义语言重建损失,我们在 Flickr30k Entities 数据集的监督设定下取得了最先进的定位性能。更重要的是,仅用 50% 的训练数据我们便能超越许多近期全监督模型,且在低至 3% 数据时仍具竞争力。

关键词

引用

@article{arxiv.1912.00076,
  title  = {OptiBox: Breaking the Limits of Proposals for Visual Grounding},
  author = {Zicong Fan and Si Yi Meng and Leonid Sigal and James J. Little},
  journal= {arXiv preprint arXiv:1912.00076},
  year   = {2019}
}